メイン コンテンツにスキップ

オーケストレーション

AI回答検証とは?

検証とは、回答を生成したモデル自身ではなく、それ以外の何かと照らし合わせて確かめる作業のことです。独立性がすべてである理由、そして自己検証が実際にはどれほどの価値しか持たないのかを解説します。

すべての解説 · 最終確認日:

独立性がすべての要点

あるモデルが訓練内の何かのために事実を作り出したなら、その事実が真実かをそのモデルに尋ねることは、それを作り出したのと同じ情報源に尋ねることになります。チェックと誤りには共通の原因があり、チェックは通ってしまいます。

有用な検証者は何かを変えます。別のモデル、実際の文書に対する検索、コンパイラ、テストスイート、スキーマバリデータ。検証者が生成器から異なるほど、多くを捉えられます。

検証の種類、弱いものから強いものへ

自己レビュー——モデルが自分の回答を読み直します。安価で、主に書式と内部矛盾を捉えます。相互モデルレビュー——別のモデルがチェックします。より良く、最初のモデルに特有の誤りを捉えます。検索——主張を検索された文書と照合します。事実の主張には強力です。実行——コードが動き、スキーマが検証され、テストが通ります。最も強力ですが、回答が実行可能な場合にのみ利用できます。

パターンとしては、強さはモデルからの独立性に伴い、利用可能性はその逆方向に進みます。最も強力なチェックは特定の種類の作業にしか存在しません。

検証と修復

問題を報告するだけの検証者は、あなたを元の場所に留めます。実際には検証は修復と組み合わされます。失敗とその理由がモデルに戻され、モデルが修正された回答を生成し、それが再び検証されます。

このループには限度が必要です。それがなければ、問題を修正できないモデルは同じ誤った回答の変化形を全額のコストで作り続けます。

よくある質問

モデルに再確認を求めることは役立ちますか?
多少は。ただし主に事実誤りではなく内部の矛盾に対してです。それは検証の最も弱い形であり、最も過信しやすいものです。
検索による検証はRAGと同じですか?
同じ仕組みを逆方向に使います。RAGは回答に情報を与えるために生成前に検索します。検索による検証は生成後に検索し、それをチェックします。
何回の修復試行が妥当ですか?
一回か二回です。モデルが二回目までに修正できていなければ、それ以降の試行は通常同じ誤りの言い換えにすぎず、人間が確認すべきです。

読むより試してみる

検証と修復はClawAIの9のオーケストレーションモードのうち二つで、どちらも試行ごとに計測されるため、修復ループが見えない請求を積み上げることはありません。