メイン コンテンツにスキップ

ユースケース

ClawAIでモデルの回答を比較する

ClawAIのCompareモードとJudgeモードが、1つのプロンプトを複数のモデルへ横並びで実行し、審判役のモデルに結果を評価させる仕組みを解説します。実際に提供済みの機能に基づいており、架空のランキングはありません。

すべてのユースケース · 最終確認日:

Compareモードが行うこと

Compareモードは1つのプロンプトを複数のモデルへ同時に送り、応答を横並びで表示します。判断が重要な場面――評価の分かれる依頼、あいまいなリクエスト、1つのモデルの捉え方が誤っているかもしれない場合――で、複数の視点を得られます。これはプランによって利用が制限される機能で、実行回数ではなくレーンごとに計測されるため、比較するモデルの数に応じてコストが変わります。

コンセンサスとbest-of-Nを正しく理解する

複数の回答を手にした後にすることには、2つの考え方があります。1つはコンセンサスで、モデル間の一致そのものが情報になるという考え方です。もう1つはbest-of-Nで、複数の候補を生成し、最も優れたものを選ぶか統合するという考え方です。それぞれが実際にどう機能するかについては、下記リンクの「AIコンセンサスとは」と「best-of-Nとは」をご覧ください。

モデルに残りを評価させる

Judgeモードは、Compareの実行結果に対して2回目のパスを行う、別のプランによって利用が制限される機能です。すべての応答を自分で読む代わりに、1つのモデルが他の応答を評価します。批評レビューは、複数モデルの比較ではなく、1つの回答をもう一度見直すための、関連する別の機能です。評価の仕組みについては、下記リンクの「AIジャッジとは」をご覧ください。

よくある質問

CompareモードとJudgeモードの違いは何ですか?
Compareモードは1つのプロンプトを複数のモデルへ実行し、すべての応答を横並びで表示します。Judgeモードは、Compareの実行結果を1つのモデルに評価させる、別のプランによって利用が制限される2回目のパスです。
Compareモードは普通のチャットメッセージより費用がかかりますか?
Compareの利用量は実行回数ではなくレーンごとに計測されます。同じプロンプトをより多くのモデルに対して実行すれば、それに比例してコストが上がります。現在の利用枠は料金ページで確認してください。
best-of-Nとは何ですか。コンセンサスと同じですか?
いいえ――コンセンサスはモデルの回答間の一致そのものを情報として扱いますが、best-of-Nは複数の候補を生成し、最も優れたものを選ぶか統合します。下記リンクの「AIコンセンサスとは」と「best-of-Nとは」をご覧ください。

説明を読むより、実際に試してみてください

ClawAIのCompareモードとJudgeモードは、実際に提供済みの、プランによって利用が制限される機能です――1つのプロンプトを複数のモデルへ実行し、任意で別のモデルに結果を評価させられます。