基礎
温度とTop-pは何を制御するのか
温度とTop-pはモデルが次のトークンをどう選ぶかを決めるもので、モデルが何を知っているかを決めるものではありません。各設定が実際に何を変えるのか、低いほうが自動的に良いとは限らない理由、そして温度ゼロでも完全に再現可能ではない理由を解説します。
すべての解説 · 最終確認日:
選択を作り変えるだけで、モデルの知識は変わらない
温度やTop-pが適用される時点で、モデルは現在のコンテキストに基づいて、あり得る次のトークンそれぞれの確率をすでに計算し終えています。どちらの設定も、その確率がどこから来たか——モデルの学習済みパラメータと与えられたコンテキスト——は変えません。すでに生成された分布から、どのようにトークンを選ぶかだけを変えます。
温度はその分布の鋭さや平坦さを調整する
温度を下げると、最も確率の高いトークンがさらに選ばれやすくなり、出力は単一の最も可能性の高い続きに偏り、実行ごとの繰り返しも増えます。温度を上げると分布は平坦になり、確率の低いトークンにも選ばれる現実的な機会が生まれ、より多様な言い回しが生まれます——同時に、あり得ない、時に奇妙なトークンが紛れ込む余地も増えます。
温度はモデルが持っていない情報を追加するものではありません。誤った推測を正しいものに変えることはできず、モデルがすでに好んでいる推測にどれだけ強くこだわるかを変えるだけです。
Top-pはそもそも検討されるトークンを制限する
Top-p(核サンプリング、nucleus samplingとも呼ばれる)は温度とは違う仕組みで動きます。すべての確率を作り変えるのではなく、まず確率の合計が選択したしきい値に達する最小の上位トークン集合まで範囲を絞り込み、その集合からのみサンプリングします。低いTop-pはモデルが最も自信を持つひと握りのトークンだけを残し、高いTop-pはより幅広い妥当な候補を許容します。温度とTop-pは通常、互いの代わりではなく、順番に組み合わせて適用されます。
温度ゼロはほぼ決定論的だが、完全に決定論的ではない
温度ゼロ、あるいは「常に最も可能性の高いトークンを選ぶ」という同等の設定は、サンプリングの手順を取り除き、原理的には同一の入力に対して出力を再現可能にするはずです。実際にはGPU上の浮動小数点演算は厳密には演算順序に依存しないわけではなく、プロバイダー側のインフラがリクエスト間で計算をバッチ処理したり並べ替えたりすることがあります。その結果、最も決定論的な設定で同じプロンプトを二回送っても、特に候補となる二つのトークンがほぼ同じ確率だった場合には、たまに異なる結果が返ってくることがあります。
設定を下げることが自動的に良くなるわけではない
ランダム性を減らすと出力はより再現しやすくなりますが、より正確になるわけではありません。自信満々に間違った続きは、低い温度でも自信満々に間違ったままです。また、非常に低い設定は、モデルが同じ安全で確率の高いトークンを繰り返し選び続けるため、長めの出力で目に見えて繰り返しの多い、硬い言い回しを生むこともあります。
適切な設定は出力の用途によって決まる
値の抽出、厳格な形式への準拠、コンパイルが通らなければならないコードの記述など、基本的に正解が一つしかないタスクは、一般に多様性より一貫性が重要なので、ランダム性を下げることが有利に働きます。ブレインストーミング、複数の言い回し案の作成、自由な文章作成など、複数の異なる答えがどれも良い場合があるタスクは、多様性そのものが目的なので、ランダム性を上げることが有利に働きます。どちらの設定も、モデルに与える文脈をより良くすることの代わりにはならず、本当に重要な答えを検証することの代わりにもなりません。
よくある質問
- 温度ゼロにすると出力は決定論的になりますか?
- ほぼそうなりますが、保証はされません。サンプリングの意図的なランダム性は取り除かれますが、浮動小数点計算とプロバイダー側のバッチ処理により、完全な同点や非常に僅差の判断でたまに異なるトークンが生成されることがあるため、同一のリクエストは通常は——常にではなく——同一になります。
- 温度とTop-pの違いは何ですか?
- 温度はあり得る次のトークンそれぞれの確率を作り変えます。Top-pはまず、確率がしきい値を超える最小の上位候補集合まで範囲を絞り込み、その集合からのみサンプリングします。両者は同じ分布に異なる方法で作用し、よく組み合わせて使われます。
- 温度を上げるとモデルはより創造的、あるいはより物知りになりますか?
- 言い回しの多様性を変えるだけで、知識や推論力は変わりません。温度を上げるとより多様な言い回しが生まれることがありますが、依然として同じ学習済みパラメータから引き出されており、可能性が低く質の劣る続きが表に出てくることも同じくらい起こり得ます。
- 事実に関するタスクでは常に最も低い設定を使うべきですか?
- 設定を下げると出力はより一貫したものになり、一貫性そのものが目的の場合には役立ちますが、根本的に誤った答えを直すわけではありません——低温度の出力は自信満々かつ繰り返し誤っている可能性があります。事実に関する主張の検証には、依然として独立した情報源や確認が必要です。
読むより試してみる
ClawAIは会話ごとに温度設定を提供し、リクエストを処理するプロバイダーに適用します。Top-pは設定として提供していないため、核サンプリングは各プロバイダーの既定値のままです。