跳至主要内容

编排

什么是 AI 裁判?

AI 裁判是指专门用来给其他模型的答案打分、进行排序的一类模型,常用于自动化的候选筛选环节。这篇文章说明它具体用在哪里、带有哪些系统性偏差,以及为什么它终究不能取代真正意义上的核实。

全部文章 · 最近核实:

裁判做什么

裁判收到原始问题和两个或更多答案,返回排名或打分,通常还附带理由。它是「N 选一最优」里的选择步骤,也是模型出现分歧时的仲裁步骤。

吸引力显而易见:它能以人工审核做不到的方式扩展,而且比它替代的那个人便宜得多。

一以贯之的偏差

裁判偏爱更长的答案,即便更短的答案已经完整。它们偏爱自信的措辞,胜过谨慎的措辞,不管这份自信是否有依据。它们对候选的呈现顺序很敏感。而被要求评判自己输出的模型,往往会偏向它。

这些没有一个是微妙难察的,也都是可以管理的——打乱顺序,让评判和撰写用不同的模型,要求具体标准而不是一般偏好。但必须刻意去管理,因为默认设置会同时表现出这四种偏差。

裁判不是验证器

裁判把答案彼此比较。它不会把答案和现实比较。面对三个都错的答案,它照样会自信地排出名次,胜出的那个仍然是错的。

在有外部检查存在的地方——测试、模式、搜索——那种检查胜过裁判,因为它独立于被评判的对象。裁判是在没有这类检查时才用的东西。

常见问题

裁判应该是最强的模型吗?
通常是一个强模型,最好不是撰写候选答案的那个模型。自我偏好是真实存在的,最便宜的解决办法就是用另一个模型。
裁判能给单个答案打分吗?
能,但比较式判断比绝对打分更可靠。模型在「这几个里哪个更好」上比在「这是 7 分还是 8 分」上表现更好。
我怎么知道裁判是对的?
抽样和你自己的判断对照检查一下。如果你从不检查,你只是把信任转移了,而不是赢得了它。

与其阅读,不如亲自试试

ClawAI 把评判作为对比运行之上的独立功能面来执行:一个打了分的答案,会同时记录撰写候选的模型和评判它们的模型。