Función
IA multimodal en ClawAI: voz, vídeo y visión
Cómo gestiona ClawAI las notas de voz, las notas de vídeo y las imágenes: transcripción, fotogramas de vídeo muestreados, un asistente de visión para modelos solo de texto y enrutamiento según el tipo de adjunto.
Todas las funciones · Última revisión:
Notas de voz y de vídeo desde el compositor
El compositor tiene un botón de grabación para notas de voz y de vídeo. Primero pide permiso, muestra una forma de onda en directo mientras grabas y limita cada grabación a cinco minutos. La grabación se transcribe —se prueba primero Gemini y OpenAI Whisper actúa como respaldo— y al modelo que responde se le indica que el mensaje llegó como nota de voz, para que conteste a lo que dijiste y no a un archivo.
El audio que ya tienes funciona igual: las subidas en WebM, OGG, MP3, MP4 y M4A, WAV, FLAC y AAC se transcriben antes de llegar al modelo.
Vídeo que el modelo puede seguir de verdad
Un vídeo subido se transcribe con marcas de tiempo, y se muestrean hasta seis fotogramas por vídeo que se muestran al modelo junto con la transcripción, para que pueda responder tanto sobre lo que ocurre en pantalla como sobre lo que se dice. Un vídeo sin sonido se indica como vídeo sin voz en lugar de producir una transcripción vacía, y puedes detener el procesamiento de un vídeo largo en cualquier momento.
Cada plan tiene una asignación de duración de vídeo fijada por el operador; al margen del plan, un vídeo nunca puede superar los treinta minutos ni la resolución 4K. Los contenedores compatibles son MP4, MOV, WebM, AVI y MPEG.
Un asistente de visión y enrutamiento según el tipo de adjunto
No todos los modelos pueden ver. Cuando el modelo que responde a un mensaje es solo de texto, un segundo modelo puede describirle hasta cuatro imágenes, incluido el texto que contengan, y al modelo que responde se le indica que trabaja a partir de una descripción. En las conversaciones Local-Only y de privacidad primero solo se usan asistentes locales servidos mediante Ollama o llama.cpp.
En el modo Auto, el enrutador también clasifica los modelos candidatos según lo bien que manejan el tipo de adjunto del mensaje, de modo que una imagen, un PDF o un vídeo suele acabar en un modelo que lo acepta de forma nativa en lugar de depender del asistente.
Preguntas frecuentes
- ¿Cuánto puede durar una nota de voz o de vídeo?
- Una grabación hecha en el compositor puede durar hasta cinco minutos. Los vídeos subidos están limitados por la asignación de duración de vídeo de tu plan, y nunca superan los treinta minutos ni la resolución 4K en ningún plan.
- ¿Qué pasa si envío una imagen a un modelo que no puede ver imágenes?
- Si el asistente de visión está habilitado en tu plan, un modelo con visión describe la imagen y transcribe su texto, y el modelo que responde trabaja a partir de esa descripción, sabiendo que es una descripción y no la imagen en sí.
- ¿ClawAI elige otro modelo por culpa de mi adjunto?
- En el modo Auto, sí: el enrutador clasifica a los candidatos según lo bien que manejan el tipo de adjunto. Si fijas tú un modelo, se respeta tu elección y el asistente de visión cubre el hueco donde esté habilitado.
Pruébalo en lugar de confiar en nuestra palabra
Las notas de voz y de vídeo, la transcripción y el enrutamiento según la modalidad ya están lanzados; el asistente de visión es una función del plan que el operador activa asignando un modelo asistente.