跳至主要内容

使用场景

用 ClawAI 比较不同模型的答案

ClawAI 的 Compare 和 Judge 模式如何让同一个提示在多个模型间并排运行,并由一个评判模型评估结果——所有说明都基于已上线的功能,不包含编造的排名。

全部使用场景 · 最近更新:

Compare 模式做什么

Compare 模式把同一个提示同时发送给多个模型,并把它们的回答并排展示,让一个重要的决定——一次判断、一个含糊不清的请求、一个某个模型的理解可能出错的场景——能得到不止一种视角。这是一项受方案控制的功能,按对比的通道而不是按单次运行计量,所以成本会随你比较的模型数量而变化。

说清楚共识和多选优选

拿到多个答案之后,有两种思路描述你接下来该怎么处理它们:共识,即模型之间达成一致这件事本身就有参考价值;以及多选优选,即生成多个候选答案,再挑选或综合出最佳的一个。下方链接的"什么是 AI 共识"和"什么是多选优选"分别说明了两者实际是如何运作的,而不是营销话术。

让一个模型来评判其他模型

Judge 模式是一项独立的受方案控制功能,会对一次 Compare 运行的结果再执行一轮评估,由一个模型来评判其他模型的回答,而不用你逐条手动阅读。评审(Critic review)是一项相关但独立的功能,用于对单个答案再看一遍,而不是跨模型比较——下方链接的"什么是 AI 评判"说明了这项评估具体如何进行。

常见问题

Compare 模式和 Judge 模式有什么区别?
Compare 模式把同一个提示发送给多个模型,并把每一个回答并排展示。Judge 模式是一项独立的、受方案控制的第二轮评估,由一个模型来评判 Compare 运行的结果,而不用你逐条阅读。
使用 Compare 模式会比普通聊天消息更贵吗?
Compare 的用量是按通道计量的,而不是按单次运行——用更多模型运行同一个提示,成本会相应增加。具体额度请在定价页确认。
什么是多选优选,它和共识是一回事吗?
不是——共识把多个模型答案之间的一致性本身视为有参考价值的信号,而多选优选是生成多个候选答案,再挑选或综合出最佳的一个。参见下方链接的"什么是 AI 共识"和"什么是多选优选"。

不必只听我们说,亲自试试看

ClawAI 的 Compare 和 Judge 模式是真实上线、受方案控制的功能——同一个提示可以在多个模型间运行,还可以选择让另一个模型来评估结果。