به محتوای اصلی بروید

مبانی

چگونه معیارهای سنجش هوش مصنوعی را بدون گمراه‌شدن بخوانیم

یک عدد معیار سنجش دقیق به‌نظر می‌رسد، و همین باعث می‌شود اعتماد بیش‌ازحد به آن آسان شود. یک نمره مثل MMLU یا HumanEval واقعاً چه چیزی را می‌سنجد، راه‌های رایج گمراه‌کنندهٔ اعداد معیار سنجش، و پیش از اینکه یکی از آن‌ها را برای کاربرد خودتان معنادار بدانید چه چیزی را باید بررسی کنید.

همهٔ توضیح‌ها · آخرین بازبینی:

معیار سنجش یک آزمون ثابت است، نه معیاری عمومی برای توانایی

معیارهای سنجش شناخته‌شده‌ای مثل MMLU (دانش عمومی چهارگزینه‌ای)، HumanEval (مسائل کوتاه برنامه‌نویسی) یا GSM8K (مسائل کلامی ریاضی سطح دبستان) هرکدام یک مهارت باریک و مشخص را در قالبی معیّن می‌سنجند. مدلی می‌تواند در یکی نمرهٔ خوبی بگیرد و در وظیفه‌ای که برای انسان شبیه به نظر می‌رسد اما ساختار متفاوتی دارد ضعیف عمل کند — مثلاً برنامه‌نویسی طولانی در برابر توابع کوتاه مجزا، یا نوشتن آزاد در برابر یادآوری چهارگزینه‌ای.

سؤال‌های معیار سنجش می‌توانند به داده‌های آموزشی نشت کنند

معیارهای سنجش محبوب عمومی‌اند، و سؤال‌های آن‌ها در وب، در مقاله‌ها و در بحث‌های انجمن‌ها به‌طور گسترده دست‌به‌دست می‌شوند — دقیقاً همان نوع متنی که مدل‌های بزرگ روی آن آموزش می‌بینند. وقتی مدلی در عمل پیش از این پاسخ را دیده باشد، نمره‌اش بازتاب‌دهندهٔ حفظ‌کردن همان آزمون مشخص است، نه توانایی عمومی‌ای که معیار سنجش قرار بوده نشان دهد. این را آلودگی می‌نامند، و تشخیص آن برای خوانندهٔ بیرونی تنها از روی نمره دشوار است.

نمرهٔ گزارش‌شده می‌تواند به‌شدت به نحوهٔ پرسش از مدل بستگی داشته باشد

یک مدل واحد می‌تواند بسته به قالب پرامپت، تعداد مثال‌های حل‌شدهٔ نشان‌داده‌شده پیش از سؤال واقعی، و اینکه آیا اجازهٔ استدلال گام‌به‌گام پیش از پاسخ داشته یا نه، نمره‌های بسیار متفاوتی بگیرد. ارائه‌دهنده‌ای که بهترین نتیجه‌اش را تحت شرایط سخاوتمندانه گزارش می‌کند دروغ نمی‌گوید، اما آن عدد ممکن است شبیه چیزی نباشد که با یک پرامپت ساده و روزمره دریافت می‌کنید.

معیارهای سنجش اشباع می‌شوند — و پس از اینکه اکثر مدل‌ها از آن‌ها عبور کردند دیگر مفید نیستند

وقتی اکثر مدل‌های پیشرو نزدیک به حداکثر در یک معیار سنجش نمره می‌گیرند، دیگر به‌طور معناداری آن‌ها را از هم متمایز نمی‌کند، هرچند عدد قدیمی‌تر اغلب هم‌چنان نقل می‌شود. نمرهٔ تقریبًا کامل در یک معیار سنجش اشباع‌شده کمتر از قبل چیزی به شما می‌گوید؛ معیارهای سنجش جدیدتر و سخت‌تر معمولاً جایش را می‌گیرند، و مقایسه‌ای بازاریابی که به یک عدد قدیمی و اشباع‌شده تکیه می‌کند ارزش نگاهی دوباره را دارد.

یک میانگین واحد دقیقاً همان‌جایی را که مدل واقعاً می‌لنگد پنهان می‌کند

نمرهٔ کلی یک معیار سنجش میانگینی از سؤال‌های زیادی با دشواری و نوع متفاوت است. مدلی می‌تواند میانگین خوبی داشته باشد در حالی‌که در یک زیرشاخهٔ مشخص که برای شما اهمیت دارد نامطمئن است — نوعی خاص از استدلال، حوزه‌ای مشخص، طول معینی از وظیفه. میانگین یک خلاصه است، و خلاصه‌ها همان جزئیاتی را دور می‌ریزند که معمولاً برای یک تصمیم واقعی بیشترین اهمیت را دارند.

با معیار سنجش مثل نقطهٔ شروع رفتار کنید، نه یک حکم قطعی

نمرهٔ معیار سنجش بیشتر به‌عنوان یک فیلتر اولیهٔ تقریبی مفید است — کنارگذاشتن مدلی که به‌وضوح نامناسب است، یا ساختن فهرست کوتاهی که ارزش آزمودن بیشتر دارد — نه به‌عنوان حرف آخر دربارهٔ اینکه کدام مدل را استفاده کنید. ببینید چگونه مدل‌های هوش مصنوعی را ارزیابی کنیم برای اینکه بدانید پس از کوتاه‌کردن فهرست، واقعاً چه چیزی تناسب را پیش‌بینی می‌کند: آزمودن روی وظایف تمثیلی خودتان، چیزی که هیچ معیار سنجش منتشرشده‌ای نمی‌تواند جایگزینش شود.

پرسش‌های پرتکرار

معیار سنجشی مثل MMLU یا HumanEval واقعاً چه چیزی را می‌آزماید؟
مجموعه‌ای ثابت و مشخص از سؤال‌ها در قالبی معیّن — MMLU دانش عمومی چهارگزینه‌ای است، HumanEval مسائل کوتاه برنامه‌نویسی است. هرکدام یک مهارت باریک را می‌سنجند، نه هوش عمومی یا توانایی در همهٔ وظایف.
چرا نمرات معیار سنجش از ارائه‌دهندگان مختلف گاهی ناسازگار به‌نظر می‌رسند؟
نمرات می‌توانند به قالب پرامپت، تعداد مثال‌های نشان‌داده‌شده پیش از سؤال واقعی، و اینکه آیا استدلال گام‌به‌گام مجاز بوده یا نه بستگی داشته باشند. شرایط گزارش‌دهی متفاوت، اعداد متفاوتی برای همان مدل زیربنایی تولید می‌کند.
آلودگی معیار سنجش چیست؟
وقتی سؤال‌های عمومی یک معیار سنجش سر از داده‌های آموزشی یک مدل درمی‌آورند، به‌طوری‌که مدل عملاً پیش از آزمایش‌شدن پاسخ‌ها را دیده است. نمرهٔ حاصل بازتاب‌دهندهٔ حفظ‌کردن است، نه توانایی‌ای که معیار سنجش برای اندازه‌گیری آن طراحی شده بود.
آیا باید نمرات معیار سنجش را کاملاً نادیده بگیرم؟
نه — آن‌ها فیلتر اولیهٔ معقولی برای کنارگذاشتن مدل‌های به‌وضوح نامناسب یا ساختن یک فهرست کوتاه هستند. فقط با عدد نهایی مثل یک حکم قطعی رفتار نکنید؛ پیش از تصمیم‌گیری فهرست کوتاه را روی وظایف تمثیلی خودتان بیازمایید.

به‌جای خواندن، امتحانش کنید

ClawAI جدول رتبه‌بندی معیار سنجش اختصاصی خودش را منتشر نمی‌کند و برای هیچ مدلی ادعای نمرهٔ اختصاصی ندارد — در عوض، پنل شفافیت مسیریابی آن رده هزینهٔ واقعی، رده تأخیر و اطمینان مسیریابی پشت یک پاسخ مشخص را نشان می‌دهد، تا بتوانید پاسخی را در برابر درخواست خودتان بسنجید، نه یک مجموعهٔ آزمون منتشرشده که نمی‌توانید بازرسی‌اش کنید.