به محتوای اصلی بروید

مبانی

تزریق پرامپت چیست؟

مدل زبانی نمی‌تواند به‌طور قابل‌اعتماد میان دستورهای شما و دستورهای پنهان در محتوایی که می‌خواند فرق بگذارد — یک صفحهٔ وب، یک سند، نتیجهٔ یک ابزار. تزریق پرامپت واقعاً چیست، چرا مدلی باهوش‌تر نمی‌تواند آن را کاملاً حل کند، و چه چیزی هنگام وقوع آن آسیب را محدود می‌کند.

همهٔ توضیح‌ها · آخرین بازبینی:

دو شکل: مستقیم و غیرمستقیم

تزریق مستقیم یعنی کسی مستقیم در چت دستورهایی تایپ می‌کند که تلاش می‌کنند رفتار مقصود سیستم را دور بزنند — از مدل می‌خواهد دستورهایش را نادیده بگیرد، پیکربندی پنهان را افشا کند، یا خارج از دامنهٔ مقصودش عمل کند. تزریق غیرمستقیم شکل پرعواقب‌تر است: دستورهایی که در محتوایی کاشته شده‌اند که مدل به نمایندگی از شما می‌خواند — یک صفحهٔ وب، ایمیل، فایل، پاسخ یک API — که هرگز قرار نبوده مدل آن‌ها را فرمان بداند اما راهی قابل‌اعتماد برای تشخیصشان از فرمان‌ها ندارد.

چرا مدلی باهوش‌تر این را به‌تنهایی حل نمی‌کند

مشکل این نیست که مدل‌ها به‌اندازهٔ کافی باهوش نیستند — این مشکلی ساختاری است. هر چیزی که مدل می‌بیند، چه درخواست شما باشد چه متنی بازیابی‌شده از منبعی نامعتبر، وقتی وارد پنجرهٔ زمینه می‌شود همان نوع دنبالهٔ توکن می‌شود. هیچ کانال جداگانه و مقاوم در برابر دستکاری‌ای برای «دستورهای معتبر» در برابر «محتوای قابل‌خواندن» وجود ندارد. مدلی توانمندتر می‌تواند در تشخیص عبارت‌پردازی‌های رایج تزریق بهتر شود، اما دستوری به‌اندازهٔ کافی پنهان‌شده — پخش‌شده در متن، غیرمستقیم بیان‌شده، پنهان در قالب‌بندی — همچنان می‌تواند رد شود، چون معماری زیربنایی هیچ مرز سختی برای اجرا ندارد.

وقتی مدل بتواند ابزار فرابخواند، خطر به‌شدت بالا می‌رود

ربات گفتگویی که فقط متن تولید می‌کند، تزریق را به خروجی بد یا گمراه‌کننده محدود می‌کند — آزاردهنده اما محصور. وقتی مدل بتواند ابزار فرابخواند (ببینید فراخوانی ابزار چگونه کار می‌کند) — ارسال ایمیل، اجرای فرمان، تغییر فایل — یک تزریق موفق می‌تواند به یک اقدام واقعی ناخواسته تبدیل شود، نه فقط یک جملهٔ بد. برای همین سیستم‌هایی که مرور وب یا خواندن سند را با دسترسی به ابزار ترکیب می‌کنند، خطر تزریق به‌طور محسوسی بیشتری از یک ربات گفتگوی ساده دارند.

فیلترکردن و محدودکردن دامنه خطر را کاهش می‌دهند؛ هیچ‌کدام آن را حذف نمی‌کنند

بررسی محتوای بازیابی‌شده برای الگوهای شناخته‌شدهٔ تزریق برخی تلاش‌ها را می‌گیرد، اما هر فهرست الگوی ثابتی را می‌توان با بیان دستور به شکلی متفاوت دور زد — این یک فیلتر است، نه تضمین. آنچه واقعاً آسیب را قابل‌اعتمادتر کاهش می‌دهد، محدودکردن کاری است که مدل اجازهٔ انجامش را دارد، صرف‌نظر از آنچه به او گفته شده: تنگ‌کردن دامنهٔ دسترسی به ابزار، الزام تأیید پیش از یک اقدام مخرب یا رو به بیرون، و هرگز ندادن مجوزهای دائمی گسترده‌تر از وظیفهٔ مشخص پیش‌رو به مدل.

محتوایی که مدل می‌خواند ورودی نامعتبر است، نه منبع حقایق بی‌طرف

هر سیستمی که به مدل اجازه می‌دهد محتوای بیرونی بخواند — نتیجهٔ جست‌وجو، صفحه‌ای استخراج‌شده، سندی که کاربر بارگذاری کرده — آن را در معرض دستورهایی قرار می‌دهد که هیچ‌کس نخواسته. پیامد عملی این است که با آن محتوا همان‌طور رفتار کنید که با ورودی کاربر تأییدنشده در هر نرم‌افزار دیگری رفتار می‌کنید: فرض کنید ممکن است چیزی خصمانه در آن باشد، و سیستم پیرامون را طوری طراحی کنید که تزریق موفق دامنهٔ محدودی داشته باشد، نه اینکه فرض کنید تزریق هرگز رخ نخواهد داد.

پرسش‌های پرتکرار

آیا تزریق پرامپت را می‌توان کاملاً جلوگیری کرد؟
نه، نه با معماری‌های کنونی مدل. هیچ جداسازی درونی و مقاوم در برابر دستکاری بین دستورهای کاربر و متنی که مدل از جای دیگر می‌خواند وجود ندارد، پس فیلترکردن و محدودکردن دامنه خطر را کاهش می‌دهند و آسیب را محدود می‌کنند اما جلوگیری را تضمین نمی‌کنند.
آیا تزریق پرامپت همان جیل‌بریک است؟
هم‌پوشانی دارند اما یکسان نیستند. جیل‌بریک معمولاً یعنی کاربری مستقیماً تلاش می‌کند مدل را وادار کند از دستورالعمل‌های خودش عبور کند. تزریق پرامپت بیشتر به دستورهای پنهان در محتوایی اشاره دارد که مدل به نمایندگی از کاربر می‌خواند، بدون آگاهی کاربر.
آیا تزریق پرامپت برای رباتی که نمی‌تواند از ابزار استفاده کند اهمیت دارد؟
خطر کوچک‌تر است — تزریق موفق می‌تواند پاسخی گمراه‌کننده یا دست‌کاری‌شده تولید کند، اما نمی‌تواند اقدامی فراتر از تولید متن انجام دهد. وقتی مدل بتواند ابزارهایی را فرابخواند که کاری خارج از گفتگو انجام می‌دهند، خطر به‌شدت بالا می‌رود.
آیا بررسی محتوا برای الگوهای تزریق حفاظت کافی است؟
تلاش‌های شناخته‌شده و قابل‌تشخیص را می‌گیرد، اما هر فهرست الگوی ثابتی را می‌توان با بازنویسی دور زد. حفاظت واقعی همچنین از محدودکردن کاری که مدل اجازهٔ انجامش را دارد می‌آید — دامنهٔ ابزار محدود و تأیید الزامی برای اقدامات پرعواقب — نه فقط از تشخیص.

به‌جای خواندن، امتحانش کنید

سرویس پژوهش ClawAI محتوای وب بازیابی‌شده را برای الگوهای شناخته‌شدهٔ تزریق پرامپت بررسی می‌کند و توکن‌های شبیه‌رمز را پیش از رسیدن آن محتوا به یک مدل سانسور می‌کند — آنچه را کشف می‌کند ثبت می‌کند نه اینکه بی‌سروصدا مسدود کند، چون هیچ فهرست الگوی ثابتی نمی‌تواند هر تلاشی را بگیرد. این لایهٔ تشخیص فقط بخشی از دفاعی است که به محدودکردن ابزارهایی که مدل اصلاً می‌تواند فرابخواند نیز وابسته است.