基礎
AIはなぜハルシネーションを起こすのか?
言語モデルは、正しい答えと同じ自信に満ちた口調で誤った答えを述べます。自分が何を知らないかを知るよう訓練されたことがないからです。ハルシネーションが起こる理由、完全には取り除けない理由、そして実際にそれを減らすものを解説します。
すべての解説 · 最終確認日:
それはモデルが報告できる誤りではなく、自信に満ちた誤った答えである
モデルには「わからない」という別モードがなく、そこに切り替えることはできません。正しくても誤っていても、あらゆる応答は同じ次トークン予測の過程から生まれるため、捏造された引用や存在しないAPIメソッドも、正しい応答とまったく同じ流暢な自信で語られます。これが、ハルシネーションを通常のソフトウェアのバグと区別するものです——例外は発生せず、フラグも立たず、捕捉できるものが何もありません。出力は正しくても誤っていても、同じくらい信頼できるように見えます。
起こる理由:検索ではなく予測
言語モデルは、訓練データのパターンから学習した、テキストのもっともらしい続きを予測するよう訓練されています。データベースのように検索可能で検証可能な形で事実を保存しているわけではなく、言語の統計的な形——その形を作るのに十分な頻度で訓練に現れた事実も含めて——を保存しています。プロンプトがモデルがほとんど見たことのない、一貫性なく見た、あるいはまったく見たことのないものを求めると、モデルは応答を拒否するのではなく、それでも最ももっともらしい続きを生成します。それがモデルにできる唯一のことだからです。
これは、具体的で珍しい、あるいは最近の詳細ほどハルシネーションが悪化する理由でもあります——本物らしく聞こえるが捏造された判例、もっともらしいが誤ったバージョン番号、実在の論文タイトルのように聞こえる引用。主張が具体的であるほど、モデルが既知の何かではなく単にもっともらしい何かで空白を埋めている可能性が高くなります。
グラウンディングは差を狭めるが、なくしはしない
モデルが応答する前に実際のソーステキストを提示すること——検索、RAGとは何かを参照——は、それらのソースが実際にカバーする質問についてハルシネーションを測定可能なほど減らします。モデルが訓練データだけから予測する代わりに、たった今読んだ内容を言い換えられるからです。しかしこれは強い傾向であって保証ではありません。検索が有用な結果を返さない場合や、ソースが不完全な場合、モデルはソースが役に立たなかったと認める代わりに、記憶から流暢に答え続けることがあります。
複数モデルの照合はフィルターであって治療法ではない
同じ質問を複数のモデルに尋ねて答えを比較すると、ある一つのモデルの訓練や癖に特有のハルシネーションを捉えられます——三つのモデルのうち一つだけが詳細を捏造すれば、その不一致は合図になります。しかし、ほとんどのモデルが共有するハルシネーションは捉えられません。訓練データはプロバイダー間で重なり合っているからです。応答を採点するために別のモデルを判定役として使う場合も同じ限界があります。判定役のモデルも、本来チェックすべきはずの、同じ種類の流暢で自信に満ちた誤ったテキストに騙されることがあります。
実際にハルシネーションを減らすもの
たった一つの手法でハルシネーションを取り除くことはできません。それはこれらのモデルがテキストを生成する仕組みの性質であって、特定のモデルやプロバイダー固有の欠陥ではないからです。測定可能な効果があるのは、モデルの仕事を絞り込むことです——ソースがカバーする質問については検索したソーステキストに答えを根拠づけ、依頼を曖昧にせず具体的に保ち、モデル自身の引用や数値や具体的な詳細を、すでに検証済みの事実としてではなく検証すべき主張として扱うことです。グラウンディングと複数モデルの照合とソースに対する検証を組み合わせることは、どれか一つだけよりも誤りの余地を減らします。
ランダム性を下げても解決しない理由
温度(温度とtop-pを参照)を下げるとモデルがより正直になると考えられがちですが、それは出力がより慎重で決定論的に見えるからにすぎません。温度はモデルが確からしい次のトークンからどう選ぶかを制御するだけで、モデルが何を知っているかを変えたり、事実確認の手順を追加したりはしません。モデルは温度ゼロでも温度一と同じ自信でハルシネーションを起こし得ます。低い設定は、同じ誤った答えをより一貫して繰り返させるだけです。
よくある質問
- ハルシネーションは完全に直せるのか?
- 現在の言語モデルのアーキテクチャでは直せません。もっともらしい続きを予測するという仕組み自体から生じるため、グラウンディングや複数モデルの照合、検証で減らせますが、カテゴリーとして取り除くことはできません。
- より大きい、あるいは新しいモデルはハルシネーションが少ないのか?
- 一般的な知識については少ないことが多いですが、それは訓練でよく表現されていたからです。根本的な仕組みは変わらないため、新しいモデルでも、あまり訓練されていない珍しい詳細については自信を持ってハルシネーションを起こし得ます。
- ハルシネーションはモデルが嘘をついているのと同じか?
- いいえ。嘘は真実を知りながら別のことを言うことを前提とします。モデルには出力を照合できる別の「真実」の経路がなく、統計的に最もらしい続きを、それが正確であってもなくても生成しているだけです。
- モデルに自分の文書を与えればハルシネーションは止まるのか?
- それらの文書が実際に答えられる質問については大きく減らせます。モデルが訓練データだけから予測する代わりに、検索したテキストを言い換えられるからです。ただし検索が関連する結果を見つけられない場合、モデルが記憶から流暢に答えることは防げません。
読むより試してみる
ClawAIはハルシネーションをなくすとは主張していません——正直な製品であれば誰もそう主張できません。提供しているのは測定可能にそれを狭める緩和策です。自分自身の文書に根拠づけた検索ベースの応答(RAGとは何かを参照)、モデル間の不一致を明らかにする複数モデル合意(AI合意とは何かを参照)、定義された基準で応答を採点するAI判定役(AI判定役とは何かを参照)——三つの独立した実在の機能であり、それぞれが保証ではなく部分的なフィルターです。