功能
ClawAI 中的多模态 AI:语音、视频与视觉
ClawAI 如何处理语音留言、视频留言和图像:语音转写、视频帧采样、为纯文本模型提供的视觉辅助,以及按附件类型进行的模型路由,本页逐一说明每项机制的工作方式与适用上限。
所有功能 · 最近审核:
在输入框中直接录制语音与视频留言
输入框里有一个用于录制语音和视频留言的按钮。它会先请求权限,录制时显示实时波形,单次录制最长五分钟。录音会被转写——优先尝试 Gemini,OpenAI Whisper 作为备用——作答的模型也会被告知这条消息是以语音留言的形式发来的,因此它回应的是你说的内容,而不是一个文件。
你已有的音频也同样适用:上传的 WebM、OGG、MP3、MP4 与 M4A、WAV、FLAC 和 AAC 文件在送达模型之前都会先被转写。
模型真正看得懂的视频
上传的视频会被转写并附带时间戳,每段视频最多采样六帧,与转写文本一起交给模型,因此它既能回答画面中发生了什么,也能回答其中说了什么。没有声音的视频会被标注为不含语音,而不是生成一份空白的转写,你也可以随时停止处理一段较长的视频。
每个方案都有由运营方设定的视频时长额度;无论哪个方案,单个视频都不能超过三十分钟或 4K 分辨率。支持的容器格式为 MP4、MOV、WebM、AVI 和 MPEG。
视觉辅助,以及按附件类型路由
并不是每个模型都能看图。当回答消息的模型只支持文本时,可以由第二个模型为它描述最多四张图片,包括图中的文字,同时作答的模型会被告知它依据的是一段描述。在 Local-Only 和隐私优先的对话中,只会使用通过 Ollama 或 llama.cpp 提供的本地辅助模型。
在 Auto 模式下,路由器还会根据候选模型处理该消息中附件类型的能力为其排序,因此图片、PDF 或视频往往会落到一个原生支持它的模型上,而不必依赖辅助模型。
常见问题
- 语音或视频留言最长可以录多久?
- 在输入框中录制的单条留言最长可达五分钟。上传的视频受你所在方案的视频时长额度限制,并且在任何方案下都不会超过三十分钟或 4K 分辨率。
- 如果我把图片发给一个看不了图片的模型,会怎样?
- 如果你的方案启用了视觉辅助,一个具备视觉能力的模型会描述这张图片并转录其中的文字,作答的模型依据这段描述工作,并且知道自己看到的是描述而不是图片本身。
- ClawAI 会因为我的附件而换一个模型吗?
- 在 Auto 模式下会:路由器会根据候选模型处理该附件类型的能力为其排序。如果你自己固定了某个模型,你的选择会被保留,而在视觉辅助已启用的情况下由它来弥补不足。
与其相信我们的话,不如亲自试试
语音与视频留言、转写以及感知模态的路由均已上线;视觉辅助是一项方案功能,由运营方通过指定辅助模型来开启。