Zum Hauptinhalt springen

Funktion

Kommentierte Recherche und Web-Crawling in ClawAI

Wie ClawAI im Web recherchiert: ein Planer, der zwischen Suchen und Crawlen wählt, ein live kommentiertes Arbeitsprotokoll, gestuftes Abrufen unter Beachtung von robots.txt und belegte Quellen.

Alle Funktionen · Zuletzt geprüft:

Ein Planer entscheidet, kein Schlüsselwort

Im Auto-Recherchemodus liest ein Planungsmodell die Nachricht und wählt einen von vier Wegen: aus vorhandenem Wissen antworten, im Web suchen, eine bestimmte Website crawlen oder erst crawlen und dann suchen. Ein eingefügter Link wird immer geöffnet. Liefert das Planungsmodell etwas Unbrauchbares, wird das nächste Modell versucht, statt die Recherche stillschweigend abzubrechen.

Sie können den Modus auch selbst im Eingabefeld wählen: aus, Auto, nur Suche, Suche mit Seitenabruf oder Suche mit Extraktion strukturierter Inhalte.

Ein Arbeitsprotokoll, dem Sie zusehen können

Jeder Schritt — der Plan, jede Suche, jede abgerufene oder übersprungene Seite — wird in Echtzeit in ein kommentiertes Protokoll über der Antwort gestreamt und mit der Antwort gespeichert, sodass es auch nach einem Neuladen noch da ist. Die Quellen, auf die sich die Antwort stützt, werden mit ihr aufgeführt, damit Sie sie selbst öffnen und prüfen können.

Gestuftes Abrufen, das sich an die Regeln hält

Seiten werden vom günstigsten Weg aufwärts abgerufen: zuerst über die offizielle API einer Website, sofern es eine gibt, dann über eine einfache HTTP-Anfrage und erst dann über einen Headless-Browser, wenn eine Seite einen braucht — mit einem Reader-Dienst und Archiv-Snapshots als spätere Fallbacks. Ein Crawl kann bis zu zweihundert Seiten einer Website umfassen.

robots.txt wird bei jedem Abruf unter dem User-Agent ClawAI-ResearchBot beachtet, und eine gesperrte Seite wird nicht auf anderem Weg erneut versucht. Anmeldeschranken und rechtliche Sperren beenden den Abruf, Captchas werden nie gelöst, jede Weiterleitung wird gegen private Netzwerkadressen geprüft, und eine archivierte Kopie wird immer als solche gekennzeichnet.

Häufig gestellte Fragen

Beachtet ClawAI robots.txt?
Ja, bei jedem Abruf, unter dem User-Agent ClawAI-ResearchBot. Eine Seite, die robots.txt sperrt, wird übersprungen und nicht über eine andere Abrufmethode erneut versucht.
Kann ich sehen, was die Recherche tatsächlich getan hat?
Ja. Ein kommentiertes Arbeitsprotokoll zeigt den Plan, jede Suche und jede abgerufene oder übersprungene Seite und wird zusammen mit der Liste der verwendeten Quellen mit der Antwort gespeichert.
Ist die Webrecherche in jedem Plan verfügbar?
Die Recherchemodi sind Planfunktionen (RESEARCH_MODE, WEB_SEARCH, WEB_FETCH und WEB_EXTRACT) mit eigenen Kontingenten, die der Betreiber pro Plan festlegt. Die Preisseite zeigt, was jeder Plan enthält.

Probieren Sie es selbst aus, statt uns zu glauben

Die Recherche-Schleife läuft in einem eigenen Recherchedienst mit vom Admin bearbeitbaren Abrufstufen und wird auf eigenen Flächen abgerechnet statt als normale Chat-Tokens.