Passer au contenu principal

Fonctionnalité

IA multimodale dans ClawAI : voix, vidéo et vision

Comment ClawAI traite les notes vocales, les notes vidéo et les images : transcription, images extraites des vidéos, un assistant de vision pour les modèles texte seul, et un routage selon le type de pièce jointe.

Toutes les fonctionnalités · Dernière révision:

Notes vocales et vidéo depuis la zone de saisie

La zone de saisie dispose d’un bouton d’enregistrement pour les notes vocales et vidéo. Il demande d’abord l’autorisation, affiche une forme d’onde en direct pendant l’enregistrement et limite chaque enregistrement à cinq minutes. L’enregistrement est transcrit — Gemini est essayé en premier, OpenAI Whisper sert de solution de repli — et le modèle qui répond est informé que le message est arrivé sous forme de note vocale, afin qu’il réponde à ce que vous avez dit plutôt qu’à un fichier.

Les fichiers audio que vous avez déjà fonctionnent de la même manière : les envois WebM, OGG, MP3, MP4 et M4A, WAV, FLAC et AAC sont transcrits avant d’atteindre le modèle.

Des vidéos que le modèle peut vraiment suivre

Une vidéo envoyée est transcrite avec horodatage, et jusqu’à six images par vidéo sont échantillonnées et montrées au modèle avec la transcription, pour qu’il puisse répondre à des questions sur ce qui se passe à l’écran autant que sur ce qui est dit. Une vidéo muette est signalée comme ne contenant aucune parole au lieu de produire une transcription vide, et vous pouvez interrompre à tout moment le traitement d’une longue vidéo.

Chaque forfait dispose d’une durée de vidéo autorisée fixée par l’opérateur ; quel que soit le forfait, une vidéo ne peut jamais dépasser trente minutes ni la résolution 4K. Les conteneurs pris en charge sont MP4, MOV, WebM, AVI et MPEG.

Un assistant de vision, et un routage selon la pièce jointe

Tous les modèles ne voient pas. Lorsque le modèle qui répond est limité au texte, un second modèle peut lui décrire jusqu’à quatre images, y compris le texte qu’elles contiennent, et le modèle qui répond sait qu’il travaille à partir d’une description. Dans les conversations en mode Local uniquement et Confidentialité d’abord, seuls des assistants locaux servis via Ollama ou llama.cpp sont utilisés.

En mode Auto, le routeur classe aussi les modèles candidats selon leur capacité à traiter le type de pièce jointe du message, si bien qu’une image, un PDF ou une vidéo aboutit en général chez un modèle qui l’accepte nativement plutôt que de dépendre de l’assistant.

Questions fréquentes

Quelle peut être la durée d’une note vocale ou vidéo ?
Un enregistrement réalisé dans la zone de saisie peut durer jusqu’à cinq minutes. Les vidéos envoyées sont limitées par la durée autorisée de votre forfait, et jamais au-delà de trente minutes ou de la résolution 4K, quel que soit le forfait.
Que se passe-t-il si j’envoie une image à un modèle qui ne voit pas les images ?
Si l’assistant de vision est activé sur votre forfait, un modèle doté de vision décrit l’image et transcrit son texte, et le modèle qui répond travaille à partir de cette description, en sachant qu’il s’agit d’une description et non de l’image elle-même.
ClawAI choisit-il un autre modèle à cause de ma pièce jointe ?
En mode Auto, oui : le routeur classe les candidats selon leur capacité à traiter le type de pièce jointe. Si vous fixez vous-même un modèle, votre choix est respecté et l’assistant de vision comble le manque là où il est activé.

Essayez-le plutôt que de nous croire sur parole

Les notes vocales et vidéo, la transcription et le routage sensible à la modalité sont livrés ; l’assistant de vision est une fonctionnalité de forfait que l’opérateur active en lui attribuant un modèle assistant.