مبانی
دما و Top-p چه چیزی را کنترل میکنند؟
دما و Top-p تعیین میکنند مدل چگونه توکن بعدی را انتخاب کند، نه اینکه چه میداند. هر تنظیم واقعاً چه چیزی را تغییر میدهد، چرا پایینتر لزوماً بهتر نیست، و چرا دمای صفر همچنان کاملاً تکرارپذیر نیست.
همهٔ توضیحها · آخرین بازبینی:
آنها یک انتخاب را بازآرایی میکنند، نه دانش مدل را
تا زمانی که دما یا Top-p اعمال شوند، مدل از پیش برای هر توکن بعدیِ ممکن با توجه به زمینهٔ فعلی یک احتمال محاسبه کرده است. هیچکدام از این تنظیمات منشأ آن احتمالها را تغییر نمیدهند — پارامترهای آموختهشدهٔ مدل و زمینهای که به آن داده شده. آنها فقط تغییر میدهند چگونه یک توکن از توزیعی که مدل از قبل تولید کرده انتخاب میشود.
دما تعیین میکند آن توزیع چقدر تیز یا مسطح باشد
دمای پایینتر باعث میشود توکنهای با بالاترین احتمال حتی محتملتر برای انتخاب شوند، پس خروجی به سمت تنها ادامهٔ محتملترین متمایل میشود و در اجراهای جداگانه بیشتر تکرار میشود. دمای بالاتر توزیع را مسطح میکند و به توکنهای کماحتمالتر شانس واقعیتری برای انتخاب میدهد، که صورتبندی متنوعتری تولید میکند — و فضای بیشتری برای عبور یک توکن نامحتمل و گاهی عجیب.
دما اطلاعاتی را که مدل ندارد اضافه نمیکند. نمیتواند حدس غلط را به درست تبدیل کند؛ فقط تغییر میدهد مدل چقدر قاطعانه به حدسی که از پیش ترجیح میدهد پایبند بماند.
Top-p محدود میکند کدام توکنها اصلاً در نظر گرفته شوند
Top-p که نمونهگیری هستهای (nucleus sampling) هم نامیده میشود، متفاوت از دما عمل میکند: بهجای بازآرایی هر احتمال، ابتدا میدان را به کوچکترین مجموعهٔ توکنهای برتر که مجموع احتمالشان به یک آستانهٔ انتخابی میرسد محدود میکند، سپس فقط از آن مجموعه نمونهگیری میکند. Top-p پایین فقط مشتی از توکنهایی را نگه میدارد که مدل بیشترین اطمینان را به آنها دارد؛ Top-p بالا طیف گستردهتری از گزینههای معقول را راه میدهد. دما و Top-p معمولاً با هم، یکی پس از دیگری، به کار میروند، نه بهجای یکدیگر.
دمای صفر نزدیک به قطعی است، نه کاملاً قطعی
دمای صفر، یا تنظیمی معادل «همیشه محتملترین توکن را انتخاب کن»، مرحلهٔ نمونهگیری را حذف میکند و در اصل باید خروجی را برای ورودی یکسان بازتولیدپذیر کند. در عمل، محاسبات ممیز شناور روی GPU دقیقاً مستقل از ترتیب نیستند، و زیرساخت ارائهدهنده میتواند محاسبات را میان درخواستها دستهبندی یا مرتبسازی مجدد کند. نتیجه این است که همان درخواست ارسالشده دو بار با محافظهکارترین تنظیم هنوز هم گاهی میتواند متفاوت برگردد، بهویژه وقتی دو توکن نامزد تقریباً برابر بودند.
تنظیم پایینتر لزوماً بهتر نیست
کاهش تصادفی بودن خروجی را تکرارپذیرتر میکند، نه درستتر. ادامهای که با اطمینان غلط است، در دمای پایین هم با همان اطمینان غلط باقی میماند، و تنظیمات بسیار پایین میتوانند در خروجیهای طولانیتر صورتبندی بهطرز محسوسی تکراری یا خشک تولید کنند، چون مدل پیوسته همان توکنهای امن و پراحتمال را دوباره انتخاب میکند.
تنظیم درست به کاربرد خروجی بستگی دارد
وظایفی که اساساً یک پاسخ درست دارند — استخراج یک مقدار، پیروی از قالبی سختگیرانه، نوشتن کدی که باید کامپایل شود — عموماً از تصادفی بودن کمتر سود میبرند، چون یکدستی مهمتر از تنوع است. وظایفی که در آنها چند پاسخ متفاوت میتوانند همه خوب باشند — طوفان فکری، پیشنویس صورتبندیهای جایگزین، نوشتن آزاد — از تصادفی بودن بیشتر سود میبرند، چون آنجا تنوع همان هدف است. هیچکدام از تنظیمات جایگزین دادن زمینهٔ بهتر به مدل نمیشود، و هیچکدام جایگزین بررسی پاسخی که واقعاً اهمیت دارد نیست.
پرسشهای پرتکرار
- آیا دمای صفر خروجی را قطعی میکند؟
- تقریباً، اما تضمینشده نیست. تصادفی بودن عمدیِ نمونهگیری را حذف میکند، اما محاسبات ممیز شناور و دستهبندی سمت ارائهدهنده هنوز هم میتوانند گاهی در یک تساوی دقیق یا تصمیمی بسیار نزدیک توکنی متفاوت تولید کنند، پس درخواستهای یکسان معمولاً — نه همیشه — یکساناند.
- تفاوت دما و Top-p چیست؟
- دما احتمال هر توکن بعدیِ ممکن را بازآرایی میکند. Top-p ابتدا میدان را به کوچکترین مجموعهٔ نامزدهای برتر که احتمالشان از یک آستانه عبور میکند محدود میکند، سپس فقط از آن مجموعه نمونهگیری میکند. آنها روی توزیع یکسانی به شکلهای متفاوت عمل میکنند و اغلب با هم ترکیب میشوند.
- آیا دمای بالاتر مدل را خلاقتر یا داناتر میکند؟
- تنوع صورتبندی را تغییر میدهد، نه دانش یا استدلال را. دمای بالاتر میتواند صورتبندی متنوعتری تولید کند، اما همچنان از همان پارامترهای آموختهشده میآید و به همان آسانی میتواند ادامهای کماحتمالتر و کمکیفیتتر را آشکار کند.
- آیا برای وظایف واقعیتمحور همیشه باید پایینترین تنظیم را انتخاب کنم؟
- تنظیم پایینتر خروجی را یکدستتر میکند، که وقتی یکدستی خودش هدف است کمک میکند، اما پاسخ نادرست زیربنایی را اصلاح نمیکند — خروجی دمای پایین میتواند با اطمینان و بهطور تکرارپذیر نادرست باشد. بررسی یک ادعای واقعی هنوز به منبعی مستقل یا آزمونی مستقل نیاز دارد.
بهجای خواندن، امتحانش کنید
ClawAI برای هر گفتوگو تنظیم دما را ارائه میدهد که روی هر ارائهدهندهای که درخواست را اجرا میکند اعمال میشود؛ Top-p را بهعنوان تنظیم ارائه نمیدهد، پس نمونهگیری هستهای در مقدار پیشفرض هر ارائهدهنده باقی میماند.