Перейти к основному содержимому

Возможность

Мультимодальный ИИ в ClawAI: голос, видео и зрение

Как ClawAI работает с голосовыми и видеосообщениями и изображениями: расшифровка, выборка кадров из видео, помощник зрения для текстовых моделей и маршрутизация по типу вложения.

Все возможности · Последняя проверка:

Голосовые и видеосообщения прямо из поля ввода

В поле ввода есть кнопка записи голосовых и видеосообщений. Сначала она запрашивает разрешение, во время записи показывает живую звуковую волну, а одна запись ограничена пятью минутами. Запись расшифровывается — сначала пробуется Gemini, запасным вариантом служит OpenAI Whisper, — и отвечающей модели сообщается, что сообщение пришло голосом, поэтому она отвечает на сказанное, а не на файл.

С уже готовым аудио всё работает так же: загрузки в форматах WebM, OGG, MP3, MP4 и M4A, WAV, FLAC и AAC расшифровываются до того, как попадут к модели.

Видео, которое модель действительно понимает

Загруженное видео расшифровывается с временными метками, а до шести кадров из каждого видео отбираются и показываются модели вместе с расшифровкой, поэтому она может ответить и на вопросы о происходящем на экране, и о том, что было сказано. Видео без звука помечается как не содержащее речи, а не превращается в пустую расшифровку, и обработку длинного видео можно остановить в любой момент.

У каждого тарифа есть лимит длительности видео, который задаёт оператор; независимо от тарифа одно видео никогда не может быть длиннее тридцати минут или выше разрешения 4K. Поддерживаются контейнеры MP4, MOV, WebM, AVI и MPEG.

Помощник зрения и маршрутизация по типу вложения

Не каждая модель умеет видеть. Если модель, отвечающая на сообщение, работает только с текстом, вторая модель может описать для неё до четырёх изображений, включая текст на них, и отвечающей модели сообщается, что она работает по описанию. В разговорах в режимах «Только локально» и «Сначала конфиденциальность» используются только локальные помощники, запущенные через Ollama или llama.cpp.

В режиме Auto маршрутизатор также ранжирует модели-кандидаты по тому, насколько хорошо они справляются с типом вложения в сообщении, поэтому изображение, PDF или видео, как правило, попадает к модели, которая принимает его напрямую, без помощи помощника.

Частые вопросы

Какой длины может быть голосовое или видеосообщение?
Одна запись, сделанная в поле ввода, может длиться до пяти минут. Загружаемые видео ограничены лимитом длительности вашего тарифа и ни на одном тарифе не могут превышать тридцать минут или разрешение 4K.
Что будет, если отправить изображение модели, которая не умеет видеть?
Если на вашем тарифе включён помощник зрения, модель с поддержкой зрения описывает изображение и расшифровывает текст на нём, а отвечающая модель работает по этому описанию, зная, что перед ней описание, а не само изображение.
Выбирает ли ClawAI другую модель из-за моего вложения?
В режиме Auto — да: маршрутизатор ранжирует кандидатов по тому, насколько хорошо они работают с типом вложения. Если вы сами закрепили модель, ваш выбор сохраняется, а пробел восполняет помощник зрения, если он включён.

Попробуйте сами, а не верьте нам на слово

Голосовые и видеосообщения, расшифровка и маршрутизация с учётом типа данных уже выпущены; помощник зрения — функция тарифа, которую оператор включает, назначая модель-помощника.