機能
ClawAIのマルチモーダルAI:音声・動画・画像認識
ClawAIが音声メモ、動画メモ、画像をどう扱うかを解説します。文字起こし、動画フレームのサンプリング、テキスト専用モデル向けのビジョンヘルパー、添付ファイルの種類に応じたルーティングまで、実装どおりにご紹介します。
すべての機能 · 最終確認日:
入力欄から音声メモと動画メモ
入力欄には音声メモと動画メモ用の録音ボタンがあります。最初に許可を求め、録音中はリアルタイムの波形を表示し、1回の録音は最長5分までです。録音は文字起こしされ(まずGeminiを試し、フォールバックとしてOpenAI Whisperを使用)、回答するモデルにはメッセージが音声メモとして届いたことが伝えられるため、ファイルではなくあなたが話した内容に応答します。
手元にある音声ファイルも同じように扱えます。WebM、OGG、MP3、MP4とM4A、WAV、FLAC、AACのアップロードは、モデルに届く前に文字起こしされます。
モデルがきちんと追える動画
アップロードされた動画はタイムスタンプ付きで文字起こしされ、1本の動画につき最大6フレームがサンプリングされて文字起こしと一緒にモデルに示されます。そのため、話されている内容だけでなく画面上で起きていることについても質問に答えられます。音声のない動画は空の文字起こしを返すのではなく「発話なし」として報告され、長い動画の処理はいつでも中止できます。
どのプランにも運営者が設定する動画の長さの割り当てがあります。プランにかかわらず、1本の動画が30分または4K解像度を超えることはできません。対応コンテナはMP4、MOV、WebM、AVI、MPEGです。
ビジョンヘルパーと、添付ファイルの種類によるルーティング
すべてのモデルが画像を認識できるわけではありません。メッセージに答えるモデルがテキスト専用の場合、別のモデルが最大4枚の画像を、画像内の文字も含めて説明し、回答するモデルには説明文をもとに作業していることが伝えられます。Local-Onlyやプライバシー優先の会話では、Ollamaまたはllama.cppで提供されるローカルのヘルパーだけが使われます。
Autoモードでは、ルーターがメッセージに含まれる添付ファイルの種類をどれだけうまく扱えるかで候補モデルを順位付けします。そのため、画像、PDF、動画は、ヘルパーに頼るのではなく、それをネイティブに受け付けるモデルに届きやすくなります。
よくある質問
- 音声メモや動画メモはどのくらいの長さまで録れますか?
- 入力欄での1回の録音は最長5分です。アップロードする動画はプランの動画の長さの割り当てによって制限され、どのプランでも30分または4K解像度を超えることはありません。
- 画像を認識できないモデルに画像を送るとどうなりますか?
- プランでビジョンヘルパーが有効になっていれば、画像を認識できるモデルが画像を説明し、その中の文字も書き起こします。回答するモデルは、それが画像そのものではなく説明文であることを理解したうえで作業します。
- ClawAIは添付ファイルに応じて別のモデルを選びますか?
- Autoモードでは選びます。ルーターは添付ファイルの種類をどれだけうまく扱えるかで候補を順位付けします。モデルを自分で固定した場合はその選択が維持され、有効になっていればビジョンヘルパーが不足を補います。
言葉より、実際に試してください
音声メモと動画メモ、文字起こし、モダリティを考慮したルーティングは出荷済みです。ビジョンヘルパーはプランの機能で、運営者がヘルパーモデルを割り当てることで有効になります。