编排
什么是 AI 答案验证?
验证是指用生成答案的那个模型之外的某种东西,比如另一个模型或一次真实检索,来核对这个答案究竟是否可信。这篇文章说明为什么独立性是这里的关键所在,以及自我核实在实践中实际上能起到多大作用。
全部文章 · 最近核实:
独立性就是全部要点
如果一个模型因为训练中的某些内容捏造了一个事实,去问同一个模型这个事实是否为真,问的正是捏造它的那个源头。核实和错误有共同的成因,所以核实会通过。
有用的验证器会改变某样东西:另一个模型、对真实文档的检索、编译器、测试套件、模式校验器。验证器和生成器差别越大,它能抓到的问题就越多。
从弱到强的验证方式
自我复查:模型重新阅读自己的答案。成本低,主要能抓到格式问题和内部矛盾。跨模型复查:另一个模型来检查。更好,能抓到第一个模型特有的错误。检索:把说法对照检索到的文档核实。对事实性说法很有效。执行:代码运行、模式通过校验、测试通过。最强,但只有在答案可执行时才可用。
这个规律是:强度随着与模型的独立性而增强,而可用性沿相反方向变化——最强的检查只存在于某些特定类型的工作中。
验证与修复
只报告问题而不做别的的验证器,让你原地不动。实践中验证通常和修复配对:失败原因回传给模型,模型生成修正后的答案,再次核实。
这个循环需要一个上限。没有上限的话,修不好问题的模型会以全价继续产出同一个错误答案的各种变体。
常见问题
- 让模型重新检查一遍有用吗?
- 有一点用,主要是针对内部不一致,而不是事实性错误。这是最弱的验证形式,也是最容易被过度信任的一种。
- 检索验证和 RAG 是一回事吗?
- 两者用的是同一套机制,方向相反。RAG 在生成之前检索,用来给答案提供信息。检索验证在生成之后检索,用来核实它。
- 合理的修复尝试次数是多少?
- 一到两次。如果模型在第二次尝试时还没修好,后续的尝试通常只是同一个错误的不同说法,应该让人来看一看。
与其阅读,不如亲自试试
验证和修复是 ClawAI 9 种编排模式中的两种,两者都按尝试次数计量,所以修复循环不会堆出一笔看不见的账单。