الانتقال إلى المحتوى الرئيسي

أساسيات

كيف تقرأ اختبارات أداء الذكاء الاصطناعي دون أن تُضلَّل

رقم اختبار الأداء يبدو دقيقًا، وهذا ما يجعل الإفراط في الثقة به سهلًا. ما الذي يقيسه فعليًا رقم مثل MMLU أو HumanEval، وطرق تضليل أرقام اختبارات الأداء الشائعة، وما يجب فحصه قبل اعتبار أحدها ذا معنى لحالتك.

كل الشروحات · آخر مراجعة:

اختبار الأداء اختبار ثابت واحد، لا مقياس عام للقدرة

اختبارات الأداء المسمّاة مثل MMLU (معرفة عامة باختيار من متعدد) وHumanEval (مسائل برمجة قصيرة) وGSM8K (مسائل رياضيات كلامية بمستوى ابتدائي) يختبر كل منها مهارة ضيقة ومحددة بصيغة محددة. قد يسجّل نموذج نتيجة جيدة في أحدها ونتيجة ضعيفة في مهمة تبدو مشابهة لإنسان لكنها مبنية بشكل مختلف — برمجة طويلة مقابل دوال معزولة قصيرة مثلًا، أو كتابة مفتوحة مقابل استرجاع باختيار من متعدد.

يمكن أن تتسرّب أسئلة اختبار الأداء إلى بيانات التدريب

اختبارات الأداء الشائعة عامة، وتتداول أسئلتها على نطاق واسع على الويب وفي الأبحاث وفي نقاشات المنتديات — بالضبط نوع النص الذي تتدرّب عليه النماذج الكبيرة. حين يكون النموذج قد رأى الإجابة فعليًا من قبل، تعكس نتيجته حفظًا لذلك الاختبار المحدد لا القدرة العامة التي يُفترض أن يمثّلها اختبار الأداء. يُسمّى هذا التلوّث، ومن الصعب على قارئ خارجي كشفه من النتيجة وحدها.

النتيجة المُبلَّغ عنها قد تعتمد بشدة على كيفية توجيه النموذج

يمكن للنموذج نفسه أن يسجّل نتائج مختلفة جدًا حسب صيغة المطالبة، وعدد الأمثلة المحلولة المعروضة قبل السؤال الحقيقي، وهل سُمح له بالاستدلال خطوة بخطوة قبل الإجابة. المزوّد الذي يُبلغ عن أفضل نتيجته في ظروف سخية لا يكذب، لكن ذلك الرقم قد لا يشبه ما تحصل عليه بمطالبة بسيطة يومية.

تتشبّع اختبارات الأداء — وتتوقف عن أن تكون مفيدة حين تجتازها معظم النماذج

حين تسجّل معظم النماذج الرائدة قريبًا من الحد الأقصى في اختبار أداء ما، يتوقف عن التمييز بينها بشكل ذي معنى، رغم أن الرقم الأقدم غالبًا ما يُقتبس رغم ذلك. النتيجة شبه الكاملة في اختبار أداء متشبّع تخبرك أقل مما كانت تخبرك سابقًا؛ وتميل اختبارات أداء أحدث وأصعب إلى استبداله، ومقارنة تسويقية تعتمد على رقم قديم متشبّع تستحق نظرة ثانية.

المتوسط الواحد يخفي بالضبط أين يعاني النموذج فعليًا

نتيجة اختبار الأداء الإجمالية متوسط عبر أسئلة كثيرة متفاوتة الصعوبة والنوع. قد يحقق نموذج متوسطًا جيدًا بينما يكون غير موثوق في فئة فرعية محددة تهمّك — نوع معيّن من الاستدلال، مجال محدد، طول معيّن من المهمة. المتوسط ملخّص، والملخصات تُسقط التفاصيل التي عادة ما تهمّ أكثر في قرار حقيقي.

عامل اختبار الأداء كنقطة بداية، لا حكمًا نهائيًا

نتيجة اختبار الأداء أنفع كمرشّح أولي تقريبي — استبعاد نموذج غير مناسب بوضوح، أو تشكيل قائمة مختصرة تستحق مزيدًا من الاختبار — لا كالكلمة الأخيرة في أي نموذج تستخدم. انظر كيف تقيّم نماذج الذكاء الاصطناعي لما الذي يتنبأ فعليًا بالملاءمة بعد أن تختصر قائمتك: الاختبار على مهامك التمثيلية الخاصة، وهو ما لا يستطيع أي اختبار أداء منشور أن يحل محله.

أسئلة يطرحها الناس

ماذا يختبر اختبار أداء مثل MMLU أو HumanEval فعليًا؟
مجموعة أسئلة ثابتة ومحددة بصيغة محددة — MMLU معرفة عامة باختيار من متعدد، وHumanEval مسائل برمجة قصيرة. كل منها يقيس مهارة ضيقة، لا ذكاءً عامًا أو قدرة عبر كل مهمة.
لماذا تبدو نتائج اختبارات الأداء من مزوّدين مختلفين غير متسقة أحيانًا؟
يمكن أن تعتمد النتائج على صيغة المطالبة، وعدد الأمثلة المعروضة قبل السؤال الحقيقي، وهل سُمح بالاستدلال خطوة بخطوة. تنتج ظروف الإبلاغ المختلفة أرقامًا مختلفة للنموذج الأساسي نفسه.
ما هو تلوّث اختبار الأداء؟
حين تنتهي أسئلة اختبار الأداء العامة في بيانات تدريب نموذج، فيكون النموذج قد رأى الإجابات فعليًا قبل اختباره. تعكس النتيجة الناتجة حفظًا لا القدرة التي صُمِّم اختبار الأداء لقياسها.
هل ينبغي أن أتجاهل نتائج اختبارات الأداء كليًا؟
لا — إنها مرشّح أولي معقول لاستبعاد نماذج غير مناسبة بوضوح أو بناء قائمة مختصرة. فقط لا تعامل الرقم النهائي كحكم؛ اختبر القائمة المختصرة على مهامك التمثيلية الخاصة قبل أن تقرر.

جرّبه بدل أن تقرأ عنه

لا ينشر ClawAI لوحة صدارة اختبارات أداء خاصة به ولا يدّعي نتيجة مملوكة لأي نموذج — بدل ذلك، تُظهر لوحة شفافية التوجيه فيه فئة الكلفة الفعلية وفئة زمن الاستجابة وثقة التوجيه وراء إجابة محددة، فتستطيع الحكم على إجابة مقابل طلبك الخاص لا مجموعة اختبار منشورة لا يمكنك فحصها.