オーケストレーション
AIジャッジとは?
AIジャッジとは、他のモデルが出した回答を採点するために使われるモデルのことです。どこで使われ、どのようなバイアスを持ち、なぜそれが本当の検証の代わりにはならないのかを具体的に解説します。
すべての解説 · 最終確認日:
ジャッジが行うこと
ジャッジは元の質問と二つ以上の回答を受け取り、順位やスコアを、たいてい理由とともに返します。それはベスト・オブ・Nにおける選択ステップであり、モデルが分かれたときの仲裁ステップです。
魅力は明白です。人間によるレビューにはできない形でスケールし、それが代わりを務める人間よりはるかに安価です。
一貫したバイアス
ジャッジは短い回答が完全であっても長い回答を好みます。自信が正当かどうかにかかわらず、控えめな言い回しより自信のある言い回しを好みます。候補の提示順に敏感です。そして自分の出力を評価するよう求められたモデルはそれを好む傾向があります。
どれも微妙なものではなく、すべて管理可能です。順序をシャッフルする、ジャッジと執筆者で異なるモデルを使う、一般的な好みではなく具体的な基準を求める。しかしこれらは意図的に管理しなければなりません。既定の設定は四つすべてを示すからです。
ジャッジは検証者ではない
ジャッジは回答同士を比較します。現実とは比較しません。三つの誤った回答を前にしても自信を持って順位をつけ、勝者は依然として誤ったままです。
テスト、スキーマ、検索といった外部チェックが存在する場所では、そのチェックがジャッジに勝ります。評価対象から独立しているからです。ジャッジは、そのようなチェックが存在しないときに使うものです。
よくある質問
- ジャッジは最も強力なモデルであるべきですか?
- 通常は強力なモデルで、できれば候補を書いたモデルとは別のものが望ましいです。自己選好は現実にあり、最も安価な修正は別のモデルを使うことです。
- ジャッジは単一の回答を採点できますか?
- できますが、比較的な判断は絶対的な採点より信頼できます。モデルは「これは7か8か」より「どちらが良いか」の方が得意です。
- ジャッジが正しいとどうわかりますか?
- 自分自身の判断と照らしてサンプルで確認してください。一度も確認しなければ、信頼を得たのではなく移しただけです。
読むより試してみる
ClawAIは比較の上に独自の面としてジャッジングを実行します。採点された回答には、候補を書いたモデルとそれらを評価したモデルの両方が記録されます。