الانتقال إلى المحتوى الرئيسي

التنسيق

ما هو التحقق من إجابات الذكاء الاصطناعي؟

التحقق يقابل الإجابة بشيء غير النموذج الذي أنتجها. لماذا الاستقلالية هي الأساس، وكم تساوي المراجعة الذاتية فعلًا.

كل الشروحات · آخر مراجعة:

الاستقلالية هي الفكرة كلها

إن اختلق نموذج واقعة بسبب شيء في تدريبه، فسؤال ذلك النموذج عن صحتها يرجع إلى المصدر نفسه الذي اختلقها. الفحص والخطأ لهما سبب مشترك، فيمرّ الفحص.

المدقّق المفيد يغيّر شيئًا. نموذج آخر، أو بحث في مستندات حقيقية، أو مترجم برمجي، أو مجموعة اختبارات، أو مدقّق مخطط. وكلما زاد اختلاف المدقّق عن المولِّد، زاد ما يستطيع التقاطه.

أنواع التحقق، من الأضعف إلى الأقوى

المراجعة الذاتية: يعيد النموذج قراءة إجابته. رخيصة، وتلتقط التنسيق والتناقضات الداخلية غالبًا. والمراجعة المتقاطعة: نموذج آخر يفحص. أفضل، وتلتقط أخطاء خاصة بالأول. والاسترجاع: يُقابَل الادعاء بمستندات مسترجَعة. قوي للادعاءات الواقعية. والتنفيذ: الشيفرة تعمل، والمخطط يُصادَق عليه، والاختبارات تنجح. الأقوى، ومتاح فقط حيث تكون الإجابة قابلة للتنفيذ.

النمط أن القوة تتبع الاستقلال عن النموذج، والتوافر يسير في الاتجاه المعاكس: الفحوص الأقوى موجودة لأنواع معيّنة من العمل فقط.

التحقق والإصلاح

المدقّق الذي يبلّغ عن مشكلة فحسب يتركك حيث كنت. عمليًا يُقرن التحقق بالإصلاح: يعود الفشل وسببه إلى نموذج، فينتج إجابة مصحّحة، فتُفحص مجددًا.

وتحتاج هذه الحلقة إلى حدّ. من دونه سيظل النموذج العاجز عن حل المشكلة ينتج صيغًا من الخطأ نفسه بالسعر الكامل.

أسئلة يطرحها الناس

هل يفيد أن تطلب من النموذج التدقيق مرة أخرى؟
قليلًا، وللتناقض الداخلي أكثر من الخطأ الواقعي. إنها أضعف صور التحقق وأسهلها للإفراط في الثقة بها.
هل التحقق بالاسترجاع هو RAG نفسه؟
يستخدمان الآلية نفسها في اتجاهين متعاكسين. يسترجع RAG قبل التوليد ليُثري الإجابة. ويسترجع التحقق بعده ليفحصها.
كم محاولة إصلاح معقولة؟
واحدة أو اثنتان. إن لم يصلحه النموذج في الثانية، فالمحاولات التالية عادةً إعادات صياغة للخطأ نفسه، وينبغي أن ينظر إنسان.

جرّبه بدل أن تقرأ عنه

التحقق والإصلاح اثنان من 9 أنماط التنسيق في ClawAI، وكلاهما يُقاس لكل محاولة، فلا تستطيع حلقة إصلاح أن تراكم فاتورة غير مرئية.