跳至主要内容

编排

什么是 AI 答案验证?

验证是指用生成答案的那个模型之外的某种东西,比如另一个模型或一次真实检索,来核对这个答案究竟是否可信。这篇文章说明为什么独立性是这里的关键所在,以及自我核实在实践中实际上能起到多大作用。

全部文章 · 最近核实:

独立性就是全部要点

如果一个模型因为训练中的某些内容捏造了一个事实,去问同一个模型这个事实是否为真,问的正是捏造它的那个源头。核实和错误有共同的成因,所以核实会通过。

有用的验证器会改变某样东西:另一个模型、对真实文档的检索、编译器、测试套件、模式校验器。验证器和生成器差别越大,它能抓到的问题就越多。

从弱到强的验证方式

自我复查:模型重新阅读自己的答案。成本低,主要能抓到格式问题和内部矛盾。跨模型复查:另一个模型来检查。更好,能抓到第一个模型特有的错误。检索:把说法对照检索到的文档核实。对事实性说法很有效。执行:代码运行、模式通过校验、测试通过。最强,但只有在答案可执行时才可用。

这个规律是:强度随着与模型的独立性而增强,而可用性沿相反方向变化——最强的检查只存在于某些特定类型的工作中。

验证与修复

只报告问题而不做别的的验证器,让你原地不动。实践中验证通常和修复配对:失败原因回传给模型,模型生成修正后的答案,再次核实。

这个循环需要一个上限。没有上限的话,修不好问题的模型会以全价继续产出同一个错误答案的各种变体。

常见问题

让模型重新检查一遍有用吗?
有一点用,主要是针对内部不一致,而不是事实性错误。这是最弱的验证形式,也是最容易被过度信任的一种。
检索验证和 RAG 是一回事吗?
两者用的是同一套机制,方向相反。RAG 在生成之前检索,用来给答案提供信息。检索验证在生成之后检索,用来核实它。
合理的修复尝试次数是多少?
一到两次。如果模型在第二次尝试时还没修好,后续的尝试通常只是同一个错误的不同说法,应该让人来看一看。

与其阅读,不如亲自试试

验证和修复是 ClawAI 9 种编排模式中的两种,两者都按尝试次数计量,所以修复循环不会堆出一笔看不见的账单。