به محتوای اصلی بروید

مبانی

دما و Top-p چه چیزی را کنترل می‌کنند؟

دما و Top-p تعیین می‌کنند مدل چگونه توکن بعدی را انتخاب کند، نه اینکه چه می‌داند. هر تنظیم واقعاً چه چیزی را تغییر می‌دهد، چرا پایین‌تر لزوماً بهتر نیست، و چرا دمای صفر همچنان کاملاً تکرارپذیر نیست.

همهٔ توضیح‌ها · آخرین بازبینی:

آن‌ها یک انتخاب را بازآرایی می‌کنند، نه دانش مدل را

تا زمانی که دما یا Top-p اعمال شوند، مدل از پیش برای هر توکن بعدیِ ممکن با توجه به زمینهٔ فعلی یک احتمال محاسبه کرده است. هیچ‌کدام از این تنظیمات منشأ آن احتمال‌ها را تغییر نمی‌دهند — پارامترهای آموخته‌شدهٔ مدل و زمینه‌ای که به آن داده شده. آن‌ها فقط تغییر می‌دهند چگونه یک توکن از توزیعی که مدل از قبل تولید کرده انتخاب می‌شود.

دما تعیین می‌کند آن توزیع چقدر تیز یا مسطح باشد

دمای پایین‌تر باعث می‌شود توکن‌های با بالاترین احتمال حتی محتمل‌تر برای انتخاب شوند، پس خروجی به سمت تنها ادامهٔ محتمل‌ترین متمایل می‌شود و در اجراهای جداگانه بیشتر تکرار می‌شود. دمای بالاتر توزیع را مسطح می‌کند و به توکن‌های کم‌احتمال‌تر شانس واقعی‌تری برای انتخاب می‌دهد، که صورت‌بندی متنوع‌تری تولید می‌کند — و فضای بیشتری برای عبور یک توکن نامحتمل و گاهی عجیب.

دما اطلاعاتی را که مدل ندارد اضافه نمی‌کند. نمی‌تواند حدس غلط را به درست تبدیل کند؛ فقط تغییر می‌دهد مدل چقدر قاطعانه به حدسی که از پیش ترجیح می‌دهد پایبند بماند.

Top-p محدود می‌کند کدام توکن‌ها اصلاً در نظر گرفته شوند

Top-p که نمونه‌گیری هسته‌ای (nucleus sampling) هم نامیده می‌شود، متفاوت از دما عمل می‌کند: به‌جای بازآرایی هر احتمال، ابتدا میدان را به کوچک‌ترین مجموعهٔ توکن‌های برتر که مجموع احتمالشان به یک آستانهٔ انتخابی می‌رسد محدود می‌کند، سپس فقط از آن مجموعه نمونه‌گیری می‌کند. Top-p پایین فقط مشتی از توکن‌هایی را نگه می‌دارد که مدل بیشترین اطمینان را به آن‌ها دارد؛ Top-p بالا طیف گسترده‌تری از گزینه‌های معقول را راه می‌دهد. دما و Top-p معمولاً با هم، یکی پس از دیگری، به کار می‌روند، نه به‌جای یکدیگر.

دمای صفر نزدیک به قطعی است، نه کاملاً قطعی

دمای صفر، یا تنظیمی معادل «همیشه محتمل‌ترین توکن را انتخاب کن»، مرحلهٔ نمونه‌گیری را حذف می‌کند و در اصل باید خروجی را برای ورودی یکسان بازتولیدپذیر کند. در عمل، محاسبات ممیز شناور روی GPU دقیقاً مستقل از ترتیب نیستند، و زیرساخت ارائه‌دهنده می‌تواند محاسبات را میان درخواست‌ها دسته‌بندی یا مرتب‌سازی مجدد کند. نتیجه این است که همان درخواست ارسال‌شده دو بار با محافظه‌کارترین تنظیم هنوز هم گاهی می‌تواند متفاوت برگردد، به‌ویژه وقتی دو توکن نامزد تقریباً برابر بودند.

تنظیم پایین‌تر لزوماً بهتر نیست

کاهش تصادفی بودن خروجی را تکرارپذیرتر می‌کند، نه درست‌تر. ادامه‌ای که با اطمینان غلط است، در دمای پایین هم با همان اطمینان غلط باقی می‌ماند، و تنظیمات بسیار پایین می‌توانند در خروجی‌های طولانی‌تر صورت‌بندی به‌طرز محسوسی تکراری یا خشک تولید کنند، چون مدل پیوسته همان توکن‌های امن و پراحتمال را دوباره انتخاب می‌کند.

تنظیم درست به کاربرد خروجی بستگی دارد

وظایفی که اساساً یک پاسخ درست دارند — استخراج یک مقدار، پیروی از قالبی سخت‌گیرانه، نوشتن کدی که باید کامپایل شود — عموماً از تصادفی بودن کمتر سود می‌برند، چون یکدستی مهم‌تر از تنوع است. وظایفی که در آن‌ها چند پاسخ متفاوت می‌توانند همه خوب باشند — طوفان فکری، پیش‌نویس صورت‌بندی‌های جایگزین، نوشتن آزاد — از تصادفی بودن بیشتر سود می‌برند، چون آنجا تنوع همان هدف است. هیچ‌کدام از تنظیمات جایگزین دادن زمینهٔ بهتر به مدل نمی‌شود، و هیچ‌کدام جایگزین بررسی پاسخی که واقعاً اهمیت دارد نیست.

پرسش‌های پرتکرار

آیا دمای صفر خروجی را قطعی می‌کند؟
تقریباً، اما تضمین‌شده نیست. تصادفی بودن عمدیِ نمونه‌گیری را حذف می‌کند، اما محاسبات ممیز شناور و دسته‌بندی سمت ارائه‌دهنده هنوز هم می‌توانند گاهی در یک تساوی دقیق یا تصمیمی بسیار نزدیک توکنی متفاوت تولید کنند، پس درخواست‌های یکسان معمولاً — نه همیشه — یکسان‌اند.
تفاوت دما و Top-p چیست؟
دما احتمال هر توکن بعدیِ ممکن را بازآرایی می‌کند. Top-p ابتدا میدان را به کوچک‌ترین مجموعهٔ نامزدهای برتر که احتمالشان از یک آستانه عبور می‌کند محدود می‌کند، سپس فقط از آن مجموعه نمونه‌گیری می‌کند. آن‌ها روی توزیع یکسانی به شکل‌های متفاوت عمل می‌کنند و اغلب با هم ترکیب می‌شوند.
آیا دمای بالاتر مدل را خلاق‌تر یا داناتر می‌کند؟
تنوع صورت‌بندی را تغییر می‌دهد، نه دانش یا استدلال را. دمای بالاتر می‌تواند صورت‌بندی متنوع‌تری تولید کند، اما همچنان از همان پارامترهای آموخته‌شده می‌آید و به همان آسانی می‌تواند ادامه‌ای کم‌احتمال‌تر و کم‌کیفیت‌تر را آشکار کند.
آیا برای وظایف واقعیت‌محور همیشه باید پایین‌ترین تنظیم را انتخاب کنم؟
تنظیم پایین‌تر خروجی را یکدست‌تر می‌کند، که وقتی یکدستی خودش هدف است کمک می‌کند، اما پاسخ نادرست زیربنایی را اصلاح نمی‌کند — خروجی دمای پایین می‌تواند با اطمینان و به‌طور تکرارپذیر نادرست باشد. بررسی یک ادعای واقعی هنوز به منبعی مستقل یا آزمونی مستقل نیاز دارد.

به‌جای خواندن، امتحانش کنید

ClawAI برای هر گفت‌وگو تنظیم دما را ارائه می‌دهد که روی هر ارائه‌دهنده‌ای که درخواست را اجرا می‌کند اعمال می‌شود؛ Top-p را به‌عنوان تنظیم ارائه نمی‌دهد، پس نمونه‌گیری هسته‌ای در مقدار پیش‌فرض هر ارائه‌دهنده باقی می‌ماند.