Возможность
Мультимодальный ИИ в ClawAI: голос, видео и зрение
Как ClawAI работает с голосовыми и видеосообщениями и изображениями: расшифровка, выборка кадров из видео, помощник зрения для текстовых моделей и маршрутизация по типу вложения.
Все возможности · Последняя проверка:
Голосовые и видеосообщения прямо из поля ввода
В поле ввода есть кнопка записи голосовых и видеосообщений. Сначала она запрашивает разрешение, во время записи показывает живую звуковую волну, а одна запись ограничена пятью минутами. Запись расшифровывается — сначала пробуется Gemini, запасным вариантом служит OpenAI Whisper, — и отвечающей модели сообщается, что сообщение пришло голосом, поэтому она отвечает на сказанное, а не на файл.
С уже готовым аудио всё работает так же: загрузки в форматах WebM, OGG, MP3, MP4 и M4A, WAV, FLAC и AAC расшифровываются до того, как попадут к модели.
Видео, которое модель действительно понимает
Загруженное видео расшифровывается с временными метками, а до шести кадров из каждого видео отбираются и показываются модели вместе с расшифровкой, поэтому она может ответить и на вопросы о происходящем на экране, и о том, что было сказано. Видео без звука помечается как не содержащее речи, а не превращается в пустую расшифровку, и обработку длинного видео можно остановить в любой момент.
У каждого тарифа есть лимит длительности видео, который задаёт оператор; независимо от тарифа одно видео никогда не может быть длиннее тридцати минут или выше разрешения 4K. Поддерживаются контейнеры MP4, MOV, WebM, AVI и MPEG.
Помощник зрения и маршрутизация по типу вложения
Не каждая модель умеет видеть. Если модель, отвечающая на сообщение, работает только с текстом, вторая модель может описать для неё до четырёх изображений, включая текст на них, и отвечающей модели сообщается, что она работает по описанию. В разговорах в режимах «Только локально» и «Сначала конфиденциальность» используются только локальные помощники, запущенные через Ollama или llama.cpp.
В режиме Auto маршрутизатор также ранжирует модели-кандидаты по тому, насколько хорошо они справляются с типом вложения в сообщении, поэтому изображение, PDF или видео, как правило, попадает к модели, которая принимает его напрямую, без помощи помощника.
Частые вопросы
- Какой длины может быть голосовое или видеосообщение?
- Одна запись, сделанная в поле ввода, может длиться до пяти минут. Загружаемые видео ограничены лимитом длительности вашего тарифа и ни на одном тарифе не могут превышать тридцать минут или разрешение 4K.
- Что будет, если отправить изображение модели, которая не умеет видеть?
- Если на вашем тарифе включён помощник зрения, модель с поддержкой зрения описывает изображение и расшифровывает текст на нём, а отвечающая модель работает по этому описанию, зная, что перед ней описание, а не само изображение.
- Выбирает ли ClawAI другую модель из-за моего вложения?
- В режиме Auto — да: маршрутизатор ранжирует кандидатов по тому, насколько хорошо они работают с типом вложения. Если вы сами закрепили модель, ваш выбор сохраняется, а пробел восполняет помощник зрения, если он включён.
Попробуйте сами, а не верьте нам на слово
Голосовые и видеосообщения, расшифровка и маршрутизация с учётом типа данных уже выпущены; помощник зрения — функция тарифа, которую оператор включает, назначая модель-помощника.