Saltar para o conteúdo principal

Recurso

IA multimodal na ClawAI: voz, vídeo e visão

Como a ClawAI lida com notas de voz, notas de vídeo e imagens: transcrição, amostragem de quadros de vídeo, um assistente de visão para modelos só de texto e roteamento por tipo de anexo.

Todos os recursos · Última revisão:

Notas de voz e de vídeo direto do compositor

O compositor tem um botão de gravação para notas de voz e de vídeo. Ele pede permissão primeiro, mostra uma forma de onda ao vivo enquanto você grava e limita cada gravação a cinco minutos. A gravação é transcrita — o Gemini é tentado primeiro e o OpenAI Whisper é o fallback — e o modelo que responde é informado de que a mensagem chegou como nota de voz, para responder ao que você disse e não a um arquivo.

O áudio que você já tem funciona da mesma forma: envios em WebM, OGG, MP3, MP4 e M4A, WAV, FLAC e AAC são transcritos antes de chegar ao modelo.

Vídeo que o modelo consegue acompanhar de verdade

Um vídeo enviado é transcrito com marcas de tempo, e até seis quadros por vídeo são amostrados e mostrados ao modelo junto com a transcrição, para que ele responda tanto sobre o que acontece na tela quanto sobre o que é dito. Um vídeo sem som é informado como sem fala, em vez de gerar uma transcrição vazia, e você pode interromper o processamento de um vídeo longo a qualquer momento.

Cada plano tem uma cota de duração de vídeo definida pelo operador; independentemente do plano, um vídeo nunca pode passar de trinta minutos nem de resolução 4K. Os contêineres aceitos são MP4, MOV, WebM, AVI e MPEG.

Um assistente de visão e roteamento por tipo de anexo

Nem todo modelo enxerga. Quando o modelo que responde a uma mensagem é só de texto, um segundo modelo pode descrever até quatro imagens para ele, incluindo qualquer texto presente nelas, e o modelo que responde é informado de que está trabalhando a partir de uma descrição. Em conversas Somente local e de privacidade em primeiro lugar, só são usados assistentes locais servidos via Ollama ou llama.cpp.

No modo Auto, o roteador também classifica os modelos candidatos pela forma como lidam com o tipo de anexo da mensagem, de modo que uma imagem, um PDF ou um vídeo tende a cair em um modelo que o aceita nativamente, sem depender do assistente.

Perguntas frequentes

Qual pode ser a duração de uma nota de voz ou de vídeo?
Uma gravação feita no compositor pode durar até cinco minutos. Os vídeos enviados são limitados pela cota de duração de vídeo do seu plano e nunca passam de trinta minutos nem de resolução 4K, em nenhum plano.
O que acontece se eu enviar uma imagem para um modelo que não enxerga imagens?
Se o assistente de visão estiver habilitado no seu plano, um modelo com visão descreve a imagem e transcreve o texto dela, e o modelo que responde trabalha a partir dessa descrição, sabendo que se trata de uma descrição e não da própria imagem.
A ClawAI escolhe outro modelo por causa do meu anexo?
No modo Auto, sim: o roteador classifica os candidatos pela forma como lidam com o tipo de anexo. Se você mesmo fixar um modelo, sua escolha é mantida e o assistente de visão cobre a lacuna onde estiver habilitado.

Experimente em vez de confiar na nossa palavra

Notas de voz e de vídeo, transcrição e roteamento sensível à modalidade já estão disponíveis; o assistente de visão é um recurso de plano que o operador ativa ao atribuir um modelo assistente.