Funktion
Multimodale KI in ClawAI: Sprache, Video und Bilder
Wie ClawAI mit Sprachnachrichten, Videonachrichten und Bildern umgeht: Transkription, ausgewählte Videoframes, ein Bild-Helfer für reine Textmodelle und Routing nach Anhangstyp.
Alle Funktionen · Zuletzt geprüft:
Sprach- und Videonachrichten direkt aus dem Eingabefeld
Das Eingabefeld hat eine Aufnahmetaste für Sprach- und Videonachrichten. Es fragt zuerst nach der Berechtigung, zeigt während der Aufnahme eine Live-Wellenform und begrenzt eine Aufnahme auf fünf Minuten. Die Aufnahme wird transkribiert — zuerst mit Gemini, OpenAI Whisper dient als Fallback — und das antwortende Modell erfährt, dass die Nachricht als Sprachnachricht kam, sodass es auf das Gesagte antwortet statt auf eine Datei.
Vorhandene Audiodateien funktionieren genauso: Uploads in WebM, OGG, MP3, MP4 und M4A, WAV, FLAC und AAC werden transkribiert, bevor sie das Modell erreichen.
Videos, denen das Modell wirklich folgen kann
Ein hochgeladenes Video wird mit Zeitstempeln transkribiert, und bis zu sechs Frames pro Video werden ausgewählt und dem Modell zusammen mit dem Transkript gezeigt. So kann es Fragen dazu beantworten, was auf dem Bildschirm passiert, und nicht nur dazu, was gesagt wird. Ein stummes Video wird als „ohne Sprache“ gemeldet, statt ein leeres Transkript zu erzeugen, und Sie können die Verarbeitung eines langen Videos jederzeit abbrechen.
Jeder Plan hat ein vom Betreiber festgelegtes Kontingent für die Videolänge; unabhängig vom Plan darf ein einzelnes Video nie länger als dreißig Minuten sein oder 4K-Auflösung überschreiten. Unterstützte Container sind MP4, MOV, WebM, AVI und MPEG.
Ein Bild-Helfer und Routing nach Anhangstyp
Nicht jedes Modell kann sehen. Ist das antwortende Modell ein reines Textmodell, kann ein zweites Modell bis zu vier Bilder für es beschreiben, einschließlich des darin enthaltenen Textes, und das antwortende Modell erfährt, dass es mit einer Beschreibung arbeitet. In Local-Only- und Privacy-First-Gesprächen werden nur lokale Helfer verwendet, die über Ollama oder llama.cpp bereitgestellt werden.
Im Auto-Modus bewertet der Router die Kandidatenmodelle außerdem danach, wie gut sie mit der Art des Anhangs umgehen. Ein Bild, ein PDF oder ein Video landet so meist bei einem Modell, das es nativ verarbeitet, statt auf den Helfer angewiesen zu sein.
Häufig gestellte Fragen
- Wie lang darf eine Sprach- oder Videonachricht sein?
- Eine im Eingabefeld erstellte Aufnahme darf bis zu fünf Minuten lang sein. Hochgeladene Videos sind durch das Videolängen-Kontingent Ihres Plans begrenzt und in keinem Plan länger als dreißig Minuten oder höher als 4K-Auflösung.
- Was passiert, wenn ich ein Bild an ein Modell sende, das keine Bilder sehen kann?
- Ist der Bild-Helfer in Ihrem Plan aktiviert, beschreibt ein bildfähiges Modell das Bild und transkribiert dessen Text. Das antwortende Modell arbeitet mit dieser Beschreibung und weiß, dass es eine Beschreibung ist und nicht das Bild selbst.
- Wählt ClawAI wegen meines Anhangs ein anderes Modell?
- Im Auto-Modus ja: Der Router bewertet die Kandidaten danach, wie gut sie mit dem Anhangstyp umgehen. Legen Sie selbst ein Modell fest, bleibt Ihre Wahl bestehen, und der Bild-Helfer schließt die Lücke, wo er aktiviert ist.
Probieren Sie es selbst aus, statt uns zu glauben
Sprach- und Videonachrichten, Transkription und modalitätsbewusstes Routing sind ausgeliefert; der Bild-Helfer ist eine Planfunktion, die ein Betreiber durch Zuweisen eines Helfermodells einschaltet.