الانتقال إلى المحتوى الرئيسي

أساسيات

ما هو حقن المطالبات؟

لا يستطيع النموذج اللغوي التمييز بموثوقية بين تعليماتك والتعليمات المخفية في المحتوى الذي يقرأه — صفحة ويب، مستند، نتيجة أداة. ما هو حقن المطالبات فعليًا، ولماذا لا يستطيع نموذج أذكى حله كليًا، وما الذي يحد من الضرر حين يحدث.

كل الشروحات · آخر مراجعة:

شكلان: مباشر وغير مباشر

الحقن المباشر هو أن يكتب أحدهم تعليمات مباشرة في المحادثة محاولًا تجاوز السلوك المقصود للنظام — يطلب من النموذج تجاهل تعليماته، أو كشف إعدادات مخفية، أو التصرف خارج نطاقه المقصود. الحقن غير المباشر هو الشكل الأخطر: تعليمات مزروعة في محتوى يقرأه النموذج نيابة عنك — صفحة ويب، بريد إلكتروني، ملف، استجابة واجهة برمجية — لم يكن مقصودًا للنموذج أن يعاملها كأوامر لكن لا يملك طريقة موثوقة لتمييزها عنها.

لماذا لا يحل نموذج أذكى هذا وحده

المشكلة ليست أن النماذج غير ذكية بما يكفي — إنها بنيوية. كل ما يراه النموذج، سواء كان طلبك أو نصًا مسترجعًا من مصدر غير موثوق، يصبح نفس نوع سلسلة الرموز بمجرد دخوله نافذة السياق. لا توجد قناة منفصلة ومحصّنة ضد التلاعب لـ«التعليمات الموثوقة» مقابل «المحتوى المُراد قراءته». يمكن لنموذج أقدر أن يصبح أفضل في التعرف على صياغة الحقن الشائعة، لكن تعليمة مموّهة بما يكفي — مقسّمة عبر النص، مصاغة بشكل غير مباشر، مخفية في التنسيق — لا تزال قادرة على الإفلات، لأن البنية الأساسية لا تملك حدًا صارمًا لفرضه.

يرتفع الخطر بشدة حين يستطيع النموذج استدعاء أدوات

روبوت محادثة ينتج نصًا فقط يحصر الحقن في مخرجات سيئة أو مضلِّلة — مزعجة، لكنها محتواة. حين يستطيع النموذج استدعاء أدوات (انظر كيف يعمل استدعاء الأدوات) — إرسال بريد إلكتروني، تشغيل أمر، تعديل ملف — يمكن لحقن ناجح أن يتحول إلى فعل حقيقي غير مرغوب فيه، لا مجرد جملة سيئة. لهذا فإن الأنظمة التي تجمع تصفح الويب أو قراءة المستندات مع الوصول إلى الأدوات تحمل خطر حقن أكبر بشكل ملموس من روبوت محادثة بسيط.

التصفية وتحديد النطاق يقللان الخطر؛ لا يزيلانه

فحص المحتوى المسترجع بحثًا عن أنماط حقن معروفة يلتقط بعض المحاولات، لكن أي قائمة أنماط ثابتة يمكن التحايل عليها بصياغة التعليمة بشكل مختلف — هذا مرشّح، لا ضمان. ما يقلل الضرر الفعلي بشكل أوثق هو تحديد ما يُسمح للنموذج فعله بصرف النظر عمّا قيل له: تضييق الوصول إلى الأدوات، واشتراط موافقة قبل فعل تدميري أو موجّه للخارج، وعدم منح النموذج أبدًا صلاحيات دائمة أوسع من المهمة المحددة أمامه.

المحتوى الذي يقرأه النموذج مدخل غير موثوق، لا مصدر حقائق محايد

أي نظام يسمح للنموذج بقراءة محتوى خارجي — نتيجة بحث، صفحة مُستخرَجة، مستند رفعه المستخدم — يعرّضه لتعليمات لم يطلبها. الأثر العملي هو معاملة ذلك المحتوى كما تعامل مدخلات مستخدم غير محقَّقة في أي برنامج آخر: افترض أنه قد يحتوي شيئًا عدائيًا، وصمّم النظام المحيط بحيث يكون لحقن ناجح مدى محدود بدل افتراض أن الحقن لن يحدث.

أسئلة يطرحها الناس

هل يمكن منع حقن المطالبات كليًا؟
لا، ليس بمعماريات النماذج الحالية. لا يوجد فصل مدمج ومحصّن ضد التلاعب بين تعليمات المستخدم والنص الذي يقرأه النموذج من مكان آخر، فالتصفية وتحديد النطاق يقللان الخطر ويحدان الضرر لكن لا يضمنان المنع.
هل حقن المطالبات هو نفسه كسر الحماية؟
يتداخلان لكنهما ليسا متطابقين. كسر الحماية عادة يعني أن يحاول مستخدم مباشرةً جعل النموذج يتجاوز إرشاداته الخاصة. حقن المطالبات يشير غالبًا إلى تعليمات مخفية في محتوى يقرأه النموذج نيابة عن المستخدم، دون علم المستخدم.
هل يهم حقن المطالبات لروبوت محادثة لا يستطيع استخدام الأدوات؟
الخطر أصغر — يمكن لحقن ناجح أن ينتج إجابة مضلِّلة أو متلاعَب بها، لكنه لا يستطيع اتخاذ فعل يتجاوز توليد النص. يرتفع الخطر بشكل كبير حين يستطيع النموذج استدعاء أدوات تفعل شيئًا خارج المحادثة.
هل فحص المحتوى بحثًا عن أنماط الحقن حماية كافية؟
يلتقط المحاولات المعروفة والقابلة للتعرف، لكن أي قائمة أنماط ثابتة يمكن التحايل عليها بإعادة الصياغة. الحماية الحقيقية تأتي أيضًا من تحديد ما يُسمح للنموذج فعله — نطاق أدوات ضيق وموافقة مطلوبة للأفعال ذات العواقب — لا من الكشف وحده.

جرّبه بدل أن تقرأ عنه

تفحص خدمة البحث في ClawAI محتوى الويب المسترجَع بحثًا عن أنماط حقن مطالبات معروفة وتُنقّح الرموز التي تبدو أسرارًا قبل أن يصل ذلك المحتوى إلى نموذج — تسجّل ما تكتشفه بدل حجبه بصمت، لأن أي قائمة أنماط ثابتة لا تستطيع التقاط كل محاولة. هذه الطبقة الكاشفة جزء واحد من دفاع يعتمد أيضًا على تحديد الأدوات التي يستطيع النموذج استدعاءها أصلًا.