مبانی
چگونه معیارهای سنجش هوش مصنوعی را بدون گمراهشدن بخوانیم
یک عدد معیار سنجش دقیق بهنظر میرسد، و همین باعث میشود اعتماد بیشازحد به آن آسان شود. یک نمره مثل MMLU یا HumanEval واقعاً چه چیزی را میسنجد، راههای رایج گمراهکنندهٔ اعداد معیار سنجش، و پیش از اینکه یکی از آنها را برای کاربرد خودتان معنادار بدانید چه چیزی را باید بررسی کنید.
همهٔ توضیحها · آخرین بازبینی:
معیار سنجش یک آزمون ثابت است، نه معیاری عمومی برای توانایی
معیارهای سنجش شناختهشدهای مثل MMLU (دانش عمومی چهارگزینهای)، HumanEval (مسائل کوتاه برنامهنویسی) یا GSM8K (مسائل کلامی ریاضی سطح دبستان) هرکدام یک مهارت باریک و مشخص را در قالبی معیّن میسنجند. مدلی میتواند در یکی نمرهٔ خوبی بگیرد و در وظیفهای که برای انسان شبیه به نظر میرسد اما ساختار متفاوتی دارد ضعیف عمل کند — مثلاً برنامهنویسی طولانی در برابر توابع کوتاه مجزا، یا نوشتن آزاد در برابر یادآوری چهارگزینهای.
سؤالهای معیار سنجش میتوانند به دادههای آموزشی نشت کنند
معیارهای سنجش محبوب عمومیاند، و سؤالهای آنها در وب، در مقالهها و در بحثهای انجمنها بهطور گسترده دستبهدست میشوند — دقیقاً همان نوع متنی که مدلهای بزرگ روی آن آموزش میبینند. وقتی مدلی در عمل پیش از این پاسخ را دیده باشد، نمرهاش بازتابدهندهٔ حفظکردن همان آزمون مشخص است، نه توانایی عمومیای که معیار سنجش قرار بوده نشان دهد. این را آلودگی مینامند، و تشخیص آن برای خوانندهٔ بیرونی تنها از روی نمره دشوار است.
نمرهٔ گزارششده میتواند بهشدت به نحوهٔ پرسش از مدل بستگی داشته باشد
یک مدل واحد میتواند بسته به قالب پرامپت، تعداد مثالهای حلشدهٔ نشاندادهشده پیش از سؤال واقعی، و اینکه آیا اجازهٔ استدلال گامبهگام پیش از پاسخ داشته یا نه، نمرههای بسیار متفاوتی بگیرد. ارائهدهندهای که بهترین نتیجهاش را تحت شرایط سخاوتمندانه گزارش میکند دروغ نمیگوید، اما آن عدد ممکن است شبیه چیزی نباشد که با یک پرامپت ساده و روزمره دریافت میکنید.
معیارهای سنجش اشباع میشوند — و پس از اینکه اکثر مدلها از آنها عبور کردند دیگر مفید نیستند
وقتی اکثر مدلهای پیشرو نزدیک به حداکثر در یک معیار سنجش نمره میگیرند، دیگر بهطور معناداری آنها را از هم متمایز نمیکند، هرچند عدد قدیمیتر اغلب همچنان نقل میشود. نمرهٔ تقریبًا کامل در یک معیار سنجش اشباعشده کمتر از قبل چیزی به شما میگوید؛ معیارهای سنجش جدیدتر و سختتر معمولاً جایش را میگیرند، و مقایسهای بازاریابی که به یک عدد قدیمی و اشباعشده تکیه میکند ارزش نگاهی دوباره را دارد.
یک میانگین واحد دقیقاً همانجایی را که مدل واقعاً میلنگد پنهان میکند
نمرهٔ کلی یک معیار سنجش میانگینی از سؤالهای زیادی با دشواری و نوع متفاوت است. مدلی میتواند میانگین خوبی داشته باشد در حالیکه در یک زیرشاخهٔ مشخص که برای شما اهمیت دارد نامطمئن است — نوعی خاص از استدلال، حوزهای مشخص، طول معینی از وظیفه. میانگین یک خلاصه است، و خلاصهها همان جزئیاتی را دور میریزند که معمولاً برای یک تصمیم واقعی بیشترین اهمیت را دارند.
با معیار سنجش مثل نقطهٔ شروع رفتار کنید، نه یک حکم قطعی
نمرهٔ معیار سنجش بیشتر بهعنوان یک فیلتر اولیهٔ تقریبی مفید است — کنارگذاشتن مدلی که بهوضوح نامناسب است، یا ساختن فهرست کوتاهی که ارزش آزمودن بیشتر دارد — نه بهعنوان حرف آخر دربارهٔ اینکه کدام مدل را استفاده کنید. ببینید چگونه مدلهای هوش مصنوعی را ارزیابی کنیم برای اینکه بدانید پس از کوتاهکردن فهرست، واقعاً چه چیزی تناسب را پیشبینی میکند: آزمودن روی وظایف تمثیلی خودتان، چیزی که هیچ معیار سنجش منتشرشدهای نمیتواند جایگزینش شود.
پرسشهای پرتکرار
- معیار سنجشی مثل MMLU یا HumanEval واقعاً چه چیزی را میآزماید؟
- مجموعهای ثابت و مشخص از سؤالها در قالبی معیّن — MMLU دانش عمومی چهارگزینهای است، HumanEval مسائل کوتاه برنامهنویسی است. هرکدام یک مهارت باریک را میسنجند، نه هوش عمومی یا توانایی در همهٔ وظایف.
- چرا نمرات معیار سنجش از ارائهدهندگان مختلف گاهی ناسازگار بهنظر میرسند؟
- نمرات میتوانند به قالب پرامپت، تعداد مثالهای نشاندادهشده پیش از سؤال واقعی، و اینکه آیا استدلال گامبهگام مجاز بوده یا نه بستگی داشته باشند. شرایط گزارشدهی متفاوت، اعداد متفاوتی برای همان مدل زیربنایی تولید میکند.
- آلودگی معیار سنجش چیست؟
- وقتی سؤالهای عمومی یک معیار سنجش سر از دادههای آموزشی یک مدل درمیآورند، بهطوریکه مدل عملاً پیش از آزمایششدن پاسخها را دیده است. نمرهٔ حاصل بازتابدهندهٔ حفظکردن است، نه تواناییای که معیار سنجش برای اندازهگیری آن طراحی شده بود.
- آیا باید نمرات معیار سنجش را کاملاً نادیده بگیرم؟
- نه — آنها فیلتر اولیهٔ معقولی برای کنارگذاشتن مدلهای بهوضوح نامناسب یا ساختن یک فهرست کوتاه هستند. فقط با عدد نهایی مثل یک حکم قطعی رفتار نکنید؛ پیش از تصمیمگیری فهرست کوتاه را روی وظایف تمثیلی خودتان بیازمایید.
بهجای خواندن، امتحانش کنید
ClawAI جدول رتبهبندی معیار سنجش اختصاصی خودش را منتشر نمیکند و برای هیچ مدلی ادعای نمرهٔ اختصاصی ندارد — در عوض، پنل شفافیت مسیریابی آن رده هزینهٔ واقعی، رده تأخیر و اطمینان مسیریابی پشت یک پاسخ مشخص را نشان میدهد، تا بتوانید پاسخی را در برابر درخواست خودتان بسنجید، نه یک مجموعهٔ آزمون منتشرشده که نمیتوانید بازرسیاش کنید.