التنسيق
ما هو حَكَم الذكاء الاصطناعي؟
حَكَم الذكاء الاصطناعي نموذج يقيّم إجابات نماذج أخرى. فيم يُستخدم، وما التحيّزات التي يحملها، ولماذا لا يغني عن فحص حقيقي.
كل الشروحات · آخر مراجعة:
ماذا يفعل الحَكَم
يتلقى الحَكَم السؤال الأصلي وإجابتين أو أكثر، ويعيد ترتيبًا أو درجة، غالبًا مع تعليل. إنه خطوة الاختيار في «الأفضل من N» وخطوة التحكيم حين تختلف النماذج.
الجاذبية واضحة: يتوسّع بطريقة لا تتوسّع بها المراجعة البشرية، وهو أرخص بكثير من الشخص الذي ينوب عنه.
التحيّزات، وهي ثابتة
يفضّل الحكّام الإجابات الأطول على الأقصر، حتى حين تكون القصيرة كاملة. ويفضّلون الصياغة الواثقة على المتحفظة، سواء كانت الثقة مبرَّرة أم لا. وهم حسّاسون لترتيب عرض المرشّحات. والنموذج الذي يُطلب منه تقييم مخرجاته يميل إلى تفضيلها.
لا شيء من هذا خفي، وكله قابل للإدارة — امزج الترتيب، واستخدم نموذجًا للحَكَم غير نموذج التأليف، واطلب معايير محدّدة بدل تفضيل عام. لكن يجب إدارتها عن قصد، لأن الإعداد الافتراضي يُظهر الأربعة جميعًا.
الحَكَم ليس مدقّقًا
يقارن الحَكَم الإجابات ببعضها. ولا يقارنها بالواقع. أمام ثلاث إجابات خاطئة سيرتّبها بثقة، وستبقى الفائزة خاطئة.
وحيث يوجد فحص خارجي — اختبارات أو مخطط أو بحث — يتفوّق ذلك الفحص على الحَكَم، لأنه مستقل عمّا يُحكم عليه. الحَكَم هو ما تستخدمه حين لا يتوفر فحص كهذا.
أسئلة يطرحها الناس
- هل ينبغي أن يكون الحَكَم أقوى نموذج؟
- عادةً نموذجًا قويًا، ويفضَّل ألا يكون النموذج نفسه الذي كتب المرشّحات. تفضيل الذات حقيقي وأرخص علاج له استخدام نموذج آخر.
- هل يستطيع الحَكَم تقييم إجابة واحدة؟
- يستطيع، لكن الحكم المقارن أوثق من التقييم المطلق. النماذج أفضل في «أي هذه أفضل» منها في «أهذه سبعة أم ثمانية».
- كيف أعرف أن الحَكَم مصيب؟
- افحصه على عيّنة مقابل حكمك أنت. إن لم تفحص أبدًا، فقد نقلت الثقة لا أنك كسبتها.
جرّبه بدل أن تقرأ عنه
يشغّل ClawAI التحكيم كواجهة مستقلة فوق تشغيل مقارنة، فتسجّل الإجابة المقيَّمة النماذج التي كتبت المرشّحات والنموذج الذي حكم عليها معًا.