跳至主要内容

功能

ClawAI 中的文件与文档处理

ClawAI 如何摄取文件——上传、分块、OCR、上传检查——并将其重新生成为图像、文档和带引用来源的调研结果,两个方向均已上线且分开计量,不含任何虚构的能力或夸大的说法。

所有功能 · 最近审核:

上传、分块与按模型交付

ClawAI 接受 PDF、DOCX、电子表格、CSV、JSON、Markdown、纯文本、代码文件和图像。文件会被切分为片段并建立索引,因此只有与问题相关的部分会进入提示词,每个模型都会收到它处理最可靠的形式——原生图像、原生 PDF 或提取出的文本——每条消息都会显示每个模型实际收到的是哪种形式。文件可以按消息附加,包括在 Compare 运行中,从而可以同时询问多个模型关于同一份文档的问题。

针对扫描文档的 OCR,以及每次上传的检查

没有文本层的扫描 PDF 在到达模型之前会先经过 OCR 处理,识别置信度较低时会被标记。每次上传都会进行病毒扫描,与声明的文件类型进行核对,检查是否存在危险文件名,如果压缩包被证实是解压炸弹则会被拒绝——上传会计入方案的文件大小和存储限额,文件会按保留计划被移除,或你随时可以自行删除。

生成图像、文档和带引用的调研结果

在输出端,ClawAI 可以根据描述生成图像,将任意回答或整段对话导出为 PDF、DOCX、CSV、HTML、Markdown、TXT 或 JSON 格式的文件,并执行搜索网络、抓取并阅读页面、以实际使用的来源作答的调研任务。图像生成、文件生成和调研各自独立计量(IMAGE、FILE_GENERATION,以及 RESEARCH_MODE / WEB_SEARCH / WEB_FETCH / WEB_EXTRACT 额度),与普通聊天的令牌使用分开。特定输出形式背后的机制请参见下方链接的“AI 工具调用的工作原理”和“什么是结构化 AI 输出”。

常见问题

我可以上传哪些类型的文件?
PDF、DOCX、电子表格、CSV、JSON、Markdown、纯文本、代码文件和图像。每个模型都会收到它处理最可靠的形式,消息会显示每个模型实际收到的是哪种形式。
ClawAI 能读取没有文本层的扫描文档吗?
可以——扫描的 PDF 在到达模型之前会先经过 OCR 处理,识别置信度较低时会被标记。
我可以将文档导出为哪些格式?
PDF、DOCX、CSV、HTML、Markdown、TXT 和 JSON。文档导出是一个独立计量的维度,与普通聊天和调研使用分开。

与其相信我们的话,不如亲自试试

输入端的上传、分块、OCR 和上传检查;输出端的图像生成、文档导出和带引用的调研结果——这些都是真实、已上线且分开计量的功能,而不是一个混杂的文件模式。