Fonctionnalité
Recherche commentée et exploration web dans ClawAI
Comment ClawAI fait ses recherches sur le web : un planificateur qui choisit de chercher ou d’explorer, un journal de travail commenté en direct, une récupération par paliers qui respecte robots.txt, et des sources citées.
Toutes les fonctionnalités · Dernière révision:
C’est un planificateur qui décide, pas un mot-clé
En mode de recherche Auto, un modèle de planification lit le message et choisit l’une de quatre voies : répondre à partir de ce qu’il sait déjà, chercher sur le web, explorer un site précis, ou explorer puis chercher. Un lien que vous collez est toujours ouvert. Si le modèle de planification renvoie un résultat inexploitable, le modèle suivant est essayé plutôt que de laisser la recherche s’arrêter en silence.
Vous pouvez aussi choisir le mode vous-même dans la zone de saisie : désactivé, Auto, recherche seule, recherche avec récupération des pages, ou recherche avec extraction de contenu structuré.
Un journal de travail que vous pouvez suivre
Chaque étape — le plan, chaque recherche, chaque page récupérée ou ignorée — est diffusée en direct dans un journal commenté au-dessus de la réponse, puis enregistrée avec la réponse pour être toujours là après un rafraîchissement. Les sources utilisées par la réponse sont listées avec elle, pour que vous puissiez les ouvrir et les vérifier vous-même.
Une récupération par paliers qui respecte les règles
Les pages sont récupérées de la méthode la moins coûteuse à la plus coûteuse : l’API officielle du site quand elle existe, puis une simple requête HTTP, puis un navigateur sans interface uniquement si la page l’exige, avec un service de lecture et des instantanés d’archives comme solutions de repli ultérieures. Une exploration peut couvrir jusqu’à deux cents pages d’un même site.
robots.txt est respecté à chaque récupération sous l’agent utilisateur ClawAI-ResearchBot, et une page interdite n’est pas retentée par un autre moyen. Les murs de connexion et les blocages juridiques arrêtent la récupération, les captchas ne sont jamais résolus, chaque redirection est vérifiée contre les adresses de réseau privé, et une copie archivée est toujours signalée comme telle.
Questions fréquentes
- ClawAI respecte-t-il robots.txt ?
- Oui, à chaque récupération, sous l’agent utilisateur ClawAI-ResearchBot. Une page interdite par robots.txt est ignorée et n’est pas retentée par une autre méthode de récupération.
- Puis-je voir ce que la recherche a réellement fait ?
- Oui. Un journal de travail commenté montre le plan, chaque recherche et chaque page récupérée ou ignorée, et il est enregistré avec la réponse, accompagné de la liste des sources utilisées.
- La recherche web est-elle disponible sur tous les forfaits ?
- Les modes de recherche sont des fonctionnalités de forfait (RESEARCH_MODE, WEB_SEARCH, WEB_FETCH et WEB_EXTRACT) avec leurs propres quotas, que l’opérateur fixe pour chaque forfait. La page des tarifs indique ce que comprend chaque forfait.
Essayez-le plutôt que de nous croire sur parole
La boucle de recherche s’exécute dans son propre service de recherche, avec des paliers de récupération modifiables par l’administrateur, et elle est décomptée sur ses propres surfaces plutôt qu’en jetons de chat ordinaires.