功能
ClawAI 中带讲解的调研与网页抓取
ClawAI 如何在网上做调研:由规划模型决定搜索还是抓取整个网站,实时讲解每一步的工作日志,遵守 robots.txt 的分级抓取,以及附带实际引用来源、可自行核对的回答。
所有功能 · 最近审核:
由规划模型决定,而不是靠关键词
在 Auto 调研模式下,一个规划模型会阅读消息,并从四条路径中选择一条:依据已有知识直接回答、搜索网络、抓取某个特定网站,或者先抓取再搜索。你粘贴的链接一定会被打开。如果规划模型返回了无法使用的结果,系统会改用下一个模型,而不是让调研悄无声息地停下。
你也可以在输入框中自行选择模式:关闭、Auto、仅搜索、搜索并抓取页面,或搜索并提取结构化内容。
一份你可以旁观的工作日志
每一步——计划、每次搜索、每个被抓取或跳过的页面——都会实时流式写入回答上方的讲解日志,并与回答一起保存,刷新页面后依然在。回答所依据的来源也会一并列出,你可以自己打开核对。
遵守规则的分级抓取
页面按成本从低到高抓取:如果网站有官方 API 就先用它,然后是普通 HTTP 请求,只有在页面确实需要时才升级到无头浏览器,阅读器服务和存档快照则作为更后面的备用手段。一次抓取最多可覆盖同一网站的两百个页面。
每次抓取都以 ClawAI-ResearchBot 用户代理遵守 robots.txt,被禁止的页面不会换一种方式重试。登录墙和法律限制会让抓取停止,验证码永远不会被破解,每次重定向都会检查是否指向私有网络地址,存档副本也始终会被标明是存档。
常见问题
- ClawAI 遵守 robots.txt 吗?
- 遵守,每次抓取都以 ClawAI-ResearchBot 用户代理进行。robots.txt 禁止的页面会被跳过,也不会通过其他抓取方式重试。
- 我能看到调研实际做了什么吗?
- 能。讲解式工作日志会展示计划、每次搜索以及每个被抓取或跳过的页面,并与回答以及所用来源列表一起保存。
- 每个方案都能使用网络调研吗?
- 调研模式属于方案功能(RESEARCH_MODE、WEB_SEARCH、WEB_FETCH 和 WEB_EXTRACT),各有自己的额度,由运营方按方案设定。价格页面列出了每个方案包含的内容。
与其相信我们的话,不如亲自试试
调研循环运行在独立的调研服务中,抓取分级可由管理员编辑,并在各自的维度上计量,而不是按普通聊天 token 计费。