功能
编排实验室:对比、评审、共识与升级
ClawAI 中让多个模型共同处理同一提示词的实验室——带 Judge 与 Critic 的 Compare、Consensus、Escalation、Best-of-N、Verify、Repair、Pipelines 等等。
所有功能 · 最近审核:
对比,并配有评审与批评者
Compare 会把同一个提示词发给多个模型,并把它们的回答并排展示,附带延迟和 token 数量。打开 Judge,一个独立模型会按明确标准为每个回答打分;打开 Critic,它会写下每个回答的薄弱之处。Compare 也能在普通会话中运行,因此你不必离开对话就能核对某一条回答。
共识与升级
Consensus 会向两到五个模型提出同一个问题,从它们的一致之处综合出一个答案,并标出它们的分歧点。Escalation 从一个便宜的模型开始,只有在回答不达标时才沿链条向上升级,因此只有在问题真正需要时,你才为强模型付费。
核验、修复,以及其他实验工具
Best-of-N 生成多个候选答案并保留最强的一个。Verify 让第二个模型检查回答是否正确。Repair 修复现有回答中的特定缺陷,而不是整体重新生成。Decompose 把一个大任务拆分成若干步骤。Role packs 让问题在按角色专精的模型之间传递,Cost ensemble 在质量与花费之间取得平衡,Pipelines 则把多个阶段串联成一个有名称、可重复运行的工作流。
每个实验室都由运营方按方案启用,实验室的运行与普通聊天分开计量——Compare、Judge 和 Critic 各有自己的维度,其余实验室计入编排维度。
常见问题
- Compare 和 Consensus 有什么区别?
- Compare 把每个模型的回答并排展示,由你自己下结论,也可以选择附上 Judge 评分。Consensus 则把多个回答合并成一个,并标出各模型意见不一致的地方。
- 升级(Escalation)是怎么帮你省钱的?
- 它先用一个较便宜的模型,只有在回答未达标准时才换用更强的模型,因此简单的问题永远不必为最昂贵的模型买单。
- 每个方案都包含这些实验室吗?
- 每个实验室都由运营方按方案开启,因此能否使用取决于你的方案。价格页面列出了每个方案包含的内容。
与其相信我们的话,不如亲自试试
Compare、Consensus、Escalation、Repair、Decompose、Best-of-N、Verify、Pipeline、Cost ensemble 和 Role pack 均已上线,各自拥有独立的页面、接口和结果卡片。