Vai al contenuto principale

Funzionalità

AI multimodale in ClawAI: voce, video e visione

Come ClawAI gestisce note vocali, note video e immagini: trascrizione, fotogrammi video campionati, un assistente visivo per i modelli solo testo e instradamento in base al tipo di allegato.

Tutte le funzionalità · Ultima revisione:

Note vocali e video direttamente dal compositore

Il compositore ha un pulsante di registrazione per note vocali e video. Chiede prima il permesso, mostra una forma d’onda in tempo reale mentre registri e limita ogni registrazione a cinque minuti. La registrazione viene trascritta — prima si prova Gemini, con OpenAI Whisper come riserva — e il modello che risponde viene informato che il messaggio è arrivato come nota vocale, così risponde a ciò che hai detto e non a un file.

L’audio che hai già funziona allo stesso modo: i caricamenti WebM, OGG, MP3, MP4 e M4A, WAV, FLAC e AAC vengono trascritti prima di raggiungere il modello.

Video che il modello riesce davvero a seguire

Un video caricato viene trascritto con i timestamp, e fino a sei fotogrammi per video vengono campionati e mostrati al modello insieme alla trascrizione, così può rispondere a domande su ciò che accade sullo schermo oltre che su ciò che viene detto. Un video muto viene segnalato come privo di parlato invece di produrre una trascrizione vuota, e puoi interrompere l’elaborazione di un video lungo in qualsiasi momento.

Ogni piano ha un limite di durata video fissato dall’operatore; indipendentemente dal piano, un singolo video non può mai superare i trenta minuti né la risoluzione 4K. I contenitori supportati sono MP4, MOV, WebM, AVI e MPEG.

Un assistente visivo, e instradamento per tipo di allegato

Non tutti i modelli vedono. Quando il modello che risponde a un messaggio è solo testo, un secondo modello può descrivergli fino a quattro immagini, compreso l’eventuale testo al loro interno, e il modello che risponde sa di lavorare su una descrizione. Nelle conversazioni Local-Only e Privacy-First si usano solo assistenti locali serviti tramite Ollama o llama.cpp.

In modalità Auto, il router ordina anche i modelli candidati in base a quanto bene gestiscono il tipo di allegato presente nel messaggio, così un’immagine, un PDF o un video tende a finire su un modello che lo accetta nativamente invece di affidarsi all’assistente.

Domande frequenti

Quanto può durare una nota vocale o video?
Una registrazione fatta nel compositore può durare fino a cinque minuti. I video caricati sono limitati dalla durata video prevista dal tuo piano, e mai oltre i trenta minuti o la risoluzione 4K, su qualsiasi piano.
Cosa succede se invio un’immagine a un modello che non vede le immagini?
Se l’assistente visivo è abilitato sul tuo piano, un modello con capacità di visione descrive l’immagine e ne trascrive il testo, e il modello che risponde lavora su quella descrizione, sapendo che si tratta di una descrizione e non dell’immagine stessa.
ClawAI sceglie un modello diverso a causa del mio allegato?
In modalità Auto, sì: il router ordina i candidati in base a quanto bene gestiscono il tipo di allegato. Se fissi tu un modello, la tua scelta viene rispettata e l’assistente visivo colma la lacuna dove è abilitato.

Provalo invece di fidarti della nostra parola

Note vocali e video, trascrizione e instradamento consapevole della modalità sono già rilasciati; l’assistente visivo è una funzionalità di piano che un operatore attiva assegnando un modello di supporto.