跳至主要内容

编排

什么是 AI 模型共识?

共识是指把同一个问题问给多个模型,把它们之间的一致意见当作一种判断信号来使用。这篇文章说明一致意见实际能说明什么、不能说明什么,以及在什么情况下这份额外成本才是合理的。

全部文章 · 最近核实:

一致意见到底说明了什么

一致意见是线索,不是证明。用重叠数据训练出来的模型会共享偏差,可能自信地朝同一个方向出错。三个模型对一个错误事实达成一致,是常见结果,不是罕见现象。

当模型真正不同时——不同厂商、不同训练、不同规模——信号才更强。同一个模型家族的三个变体之间的共识,几乎没有价值。

分歧才是更有用的输出

共识的实际价值通常在负面情形里。当模型出现分歧时,你就定位到了一个需要人来处理的问题——用低成本定位到这些问题,比在原本就简单的问题上多一点点信心更有价值。

这重新定义了什么时候该用它。共识不是套用到一切上的质量提升,而是应用在出错代价高的地方的分诊工具。

成本

运行三个模型大约花三倍 token,耗时和最慢的那个一样长。在日常问题上,这纯粹是浪费。在一份合同条款、一个迁移计划,或者你打算据此行动的医疗摘要上,这个价钱不贵。

什么时候不要用

对有可核实答案的问题,不要用共识。如果代码能不能编译是明确的,直接运行它——这比三个模型达成一致更强的信号。共识是给那些没有廉价外部核实手段的判断性问题用的。

常见问题

我需要多少个模型?
三个是通常的选择,因为两个只能一致或不一致,而三个能显示出分歧的形状。超过三个很少会改变决策,却会成倍增加账单。
共识能防止幻觉吗?
不能。它能捕捉某个模型特有的幻觉,却会漏掉多个模型共有的那些。它是一个过滤器,不是保证。
这和「N 选一最优」是一回事吗?
不是。共识比较不同模型的答案,看它们是否一致。「N 选一最优」生成多个候选然后选一个。共识衡量一致性;「N 选一最优」挑选质量。

与其阅读,不如亲自试试

共识是 ClawAI 9 种编排模式之一,每次运行都会记录用到的所有模型以及花费。