メイン コンテンツにスキップ

基礎

誤解せずにAIベンチマークを読む方法

ベンチマークの数字は正確に見えるため、必要以上に信頼してしまいがちです。MMLUやHumanEvalのようなスコアが実際に何を測っているか、ベンチマーク数字がよくある形で誤解を招く理由、そしてそれを自分の用途にとって意味があると見なす前に確認すべきことを解説します。

すべての解説 · 最終確認日:

ベンチマークは一つの固定テストであり、能力の一般的な尺度ではない

MMLU(多肢選択式の一般知識)、HumanEval(短いコーディング問題)、GSM8K(小学校レベルの算数の文章題)といった有名なベンチマークは、それぞれ特定の形式で狭い特定のスキルをテストします。あるモデルは一つで高得点でも、人間には似て見えるが構造が異なるタスク——たとえば短い独立した関数ではなく長いコーディング、あるいは多肢選択の記憶ではなく自由形式の文章作成——では劣ることがあります。

ベンチマークの問題が訓練データに漏れることがある

人気のベンチマークは公開されており、その問題はウェブや論文、フォーラムの議論に広く出回っています——まさに大規模モデルが訓練に使うのと同じ種類のテキストです。モデルが実質的に答えを既に見ている場合、そのスコアはその特定のテストでの暗記を反映しているのであって、ベンチマークが表そうとしていた一般的な能力ではありません。これは汚染と呼ばれ、スコアだけから外部の読者が見抜くのは困難です。

報告されるスコアはモデルへの質問の仕方に大きく左右されうる

同じモデルでも、プロンプトの形式、本当の質問の前に示された解答例の数、答える前に段階的に推論することが許されていたかによって、非常に異なるスコアになり得ます。寛大な条件下での最良の結果を報告するプロバイダーは嘘をついているわけではありませんが、その数字は普通の日常的なプロンプトで得られるものとは似ていないかもしれません。

ベンチマークは飽和する——ほとんどのモデルが合格すると役に立たなくなる

ほとんどの主要モデルがあるベンチマークで上限近くのスコアを取るようになると、そのベンチマークはもはや意味のある形でモデルを区別しなくなりますが、古い数字はそれでも引用され続けることが多くあります。飽和したベンチマークでのほぼ満点のスコアは、以前ほどの情報を伝えません。新しくより難しいベンチマークがそれに取って代わる傾向があり、古い飽和した数字に頼るマーケティング上の比較は、もう一度確認する価値があります。

一つの平均スコアは、モデルが実際に苦戦している箇所をまさに隠してしまう

全体的なベンチマークスコアは、難易度や種類の異なる多くの問題の平均です。モデルは平均では良い結果を出しながら、あなたにとって重要な特定のサブカテゴリー——特定の種類の推論、特定の分野、特定の長さのタスク——では信頼できないことがあります。平均は要約であり、要約は実際の判断にとって最も重要なことが多い詳細を捨ててしまいます。

ベンチマークは出発点として扱い、結論として扱わない

ベンチマークスコアが最も役立つのは、明らかに不向きなモデルを除外したり、さらにテストする価値のある候補を絞り込んだりする大まかな最初のフィルターとしてであり、どのモデルを使うべきかの最終結論としてではありません。候補を絞り込んだあとに実際に適合性を予測するものについては、AIモデルの評価方法を参照してください——自分自身の代表的なタスクでのテストであり、公開されたベンチマークがそれに代わることはできません。

よくある質問

MMLUやHumanEvalのようなベンチマークは実際に何をテストしていますか?
特定の形式の固定された特定の問題セットです——MMLUは多肢選択式の一般知識、HumanEvalは短いコーディング問題です。それぞれ狭いスキルを測るのであって、あらゆるタスクにわたる一般知能や能力ではありません。
なぜプロバイダーによってベンチマークスコアが矛盾しているように見えることがあるのですか?
スコアはプロンプトの形式、本当の質問の前に示された例の数、段階的な推論が許されていたかどうかに左右されます。報告条件が異なれば、同じ基盤モデルでも異なる数字が出ます。
ベンチマーク汚染とは何ですか?
ベンチマークの公開されている問題がモデルの訓練データに入り込み、モデルがテストされる前に実質的に答えを既に見てしまっている状態です。その結果生じるスコアは、ベンチマークが測ろうとしていた能力ではなく、暗記を反映しています。
ベンチマークスコアは完全に無視すべきですか?
いいえ——明らかに不向きなモデルを除外したり、候補リストを作ったりするための妥当な最初のフィルターにはなります。ただ最終的な数字を結論として扱わず、決める前に候補リストを自分自身の代表的なタスクでテストしてください。

読むより試してみる

ClawAIは独自のベンチマークリーダーボードを公開したり、どのモデルについても専有的なスコアを主張したりしていません——代わりに、ルーティング透明性パネルが特定の回答の背後にある実際のコストクラス、レイテンシークラス、ルーティングの確信度を表示するので、検証できない公開されたテストセットではなく、自分自身のリクエストに対して回答を判断できます。