Recurso
IA multimodal na ClawAI: voz, vídeo e visão
Como a ClawAI lida com notas de voz, notas de vídeo e imagens: transcrição, amostragem de quadros de vídeo, um assistente de visão para modelos só de texto e roteamento por tipo de anexo.
Todos os recursos · Última revisão:
Notas de voz e de vídeo direto do compositor
O compositor tem um botão de gravação para notas de voz e de vídeo. Ele pede permissão primeiro, mostra uma forma de onda ao vivo enquanto você grava e limita cada gravação a cinco minutos. A gravação é transcrita — o Gemini é tentado primeiro e o OpenAI Whisper é o fallback — e o modelo que responde é informado de que a mensagem chegou como nota de voz, para responder ao que você disse e não a um arquivo.
O áudio que você já tem funciona da mesma forma: envios em WebM, OGG, MP3, MP4 e M4A, WAV, FLAC e AAC são transcritos antes de chegar ao modelo.
Vídeo que o modelo consegue acompanhar de verdade
Um vídeo enviado é transcrito com marcas de tempo, e até seis quadros por vídeo são amostrados e mostrados ao modelo junto com a transcrição, para que ele responda tanto sobre o que acontece na tela quanto sobre o que é dito. Um vídeo sem som é informado como sem fala, em vez de gerar uma transcrição vazia, e você pode interromper o processamento de um vídeo longo a qualquer momento.
Cada plano tem uma cota de duração de vídeo definida pelo operador; independentemente do plano, um vídeo nunca pode passar de trinta minutos nem de resolução 4K. Os contêineres aceitos são MP4, MOV, WebM, AVI e MPEG.
Um assistente de visão e roteamento por tipo de anexo
Nem todo modelo enxerga. Quando o modelo que responde a uma mensagem é só de texto, um segundo modelo pode descrever até quatro imagens para ele, incluindo qualquer texto presente nelas, e o modelo que responde é informado de que está trabalhando a partir de uma descrição. Em conversas Somente local e de privacidade em primeiro lugar, só são usados assistentes locais servidos via Ollama ou llama.cpp.
No modo Auto, o roteador também classifica os modelos candidatos pela forma como lidam com o tipo de anexo da mensagem, de modo que uma imagem, um PDF ou um vídeo tende a cair em um modelo que o aceita nativamente, sem depender do assistente.
Perguntas frequentes
- Qual pode ser a duração de uma nota de voz ou de vídeo?
- Uma gravação feita no compositor pode durar até cinco minutos. Os vídeos enviados são limitados pela cota de duração de vídeo do seu plano e nunca passam de trinta minutos nem de resolução 4K, em nenhum plano.
- O que acontece se eu enviar uma imagem para um modelo que não enxerga imagens?
- Se o assistente de visão estiver habilitado no seu plano, um modelo com visão descreve a imagem e transcreve o texto dela, e o modelo que responde trabalha a partir dessa descrição, sabendo que se trata de uma descrição e não da própria imagem.
- A ClawAI escolhe outro modelo por causa do meu anexo?
- No modo Auto, sim: o roteador classifica os candidatos pela forma como lidam com o tipo de anexo. Se você mesmo fixar um modelo, sua escolha é mantida e o assistente de visão cobre a lacuna onde estiver habilitado.
Experimente em vez de confiar na nossa palavra
Notas de voz e de vídeo, transcrição e roteamento sensível à modalidade já estão disponíveis; o assistente de visão é um recurso de plano que o operador ativa ao atribuir um modelo assistente.