مبانی
چرا هوش مصنوعی توهم میزند؟
یک مدل زبانی پاسخی نادرست را با همان لحن مطمئنی بیان میکند که پاسخی درست را، چون هرگز آموزش ندیده که بداند چه چیزی را نمیداند. چرا توهم رخ میدهد، چرا نمیتوان آن را کاملاً حذف کرد، و چه چیزی واقعاً آن را کاهش میدهد.
همهٔ توضیحها · آخرین بازبینی:
این یک پاسخ نادرستِ مطمئن است، نه خطایی که مدل بتواند گزارش دهد
مدل حالت جداگانهای برای «نمیدانم» ندارد که به آن برگردد. هر پاسخ، درست یا نادرست، از همان فرایند پیشبینی توکن بعدی میآید، پس یک استناد ساختگی یا یک متد API که وجود ندارد با همان اطمینان روان یک پاسخ درست خوانده میشود. همین چیزی است که توهم را از یک باگ نرمافزاری معمولی متفاوت میکند — هیچ استثنایی پرتاب نمیشود، هیچ پرچمی بالا نمیرود، چیزی برای گرفتن وجود ندارد. خروجی چه درست باشد چه نادرست، دقیقاً به همان اندازه قابلاعتماد به نظر میرسد.
چرا رخ میدهد: پیشبینی، نه جستوجو
مدل زبانی آموزش دیده تا ادامهٔ محتمل متن را پیشبینی کند، بر اساس الگوهایی که از دادههای آموزشیاش یاد گرفته. برخلاف پایگاهداده، حقایق را به شکلی بازیابیپذیر و قابلراستیآزمایی ذخیره نمیکند — شکل آماری زبان را ذخیره میکند، از جمله حقایقی که در آموزش بهاندازهٔ کافی رایج بودهاند تا آن شکل را بسازند. وقتی پرامپتی چیزی میخواهد که مدل کم دیده، ناهماهنگ دیده یا اصلاً ندیده، مدل از پاسخدادن کوتاهی نمیکند؛ بههرحال محتملترین ادامه را تولید میکند، چون تنها کاری است که بلد است.
همین موضوع توضیح میدهد چرا توهم با جزئیات خاص، کمیاب یا اخیر بدتر میشود — پروندهای قضایی که واقعی بهنظر میرسد اما ساختگی است، شمارهٔ نسخهای محتمل اما نادرست، استنادی که مثل عنوان یک مقالهٔ واقعی بهنظر میرسد. هرچه ادعا خاصتر باشد، احتمال بیشتری دارد که مدل یک شکاف را با چیزی صرفاً محتمل پر کند، نه چیزی که واقعاً میداند.
زمینهسازی شکاف را کوچک میکند، نه اینکه ببندد
قراردادن متن منبع واقعی جلوی مدل پیش از پاسخدادن — بازیابی، ببینید RAG چیست — توهم را در پرسشهایی که آن منابع واقعاً پوشش میدهند، بهشکل قابلسنجش کاهش میدهد، چون مدل میتواند آنچه تازه خوانده را بازگو کند، نه اینکه فقط از دادههای آموزشی پیشبینی کند. اما این یک تمایل قوی است، نه یک تضمین: اگر بازیابی چیز مفیدی برنگرداند، یا منابع ناقص باشند، مدل همچنان میتواند روان از حافظه پاسخ دهد، بهجای اینکه بپذیرد منابع کمکی نکردهاند.
مقایسهٔ چند مدل یک فیلتر است، نه درمان
پرسیدن یک سؤال یکسان از چند مدل و مقایسهٔ پاسخها، توهمهایی را میگیرد که مخصوص آموزش یا ویژگیهای یک مدل هستند — اگر فقط یکی از سه مدل جزئیاتی را بسازد، آن اختلاف یک سیگنال است. اما توهمی را که اکثر مدلها مشترکاً دارند نمیگیرد، چون دادههای آموزشی میان ارائهدهندگان همپوشانی دارند. همین محدودیت دربارهٔ استفاده از یک مدل جدا بهعنوان داور برای نمرهدادن به پاسخ هم صدق میکند: مدل داور میتواند فریب همان نوع متن روان، مطمئن و نادرستی را بخورد که قرار است بررسیاش کند.
چه چیزی واقعاً در عمل توهم را کاهش میدهد
هیچ تکنیک واحدی توهم را حذف نمیکند، چون این یک ویژگی از نحوهٔ تولید متن این مدلهاست، نه یک اشکال مخصوص یک مدل یا ارائهدهنده. آنچه واقعاً کمک میکند، محدودکردن وظیفهٔ مدل است: مبتنیکردن پاسخها بر متن منبع بازیابیشده برای پرسشهایی که منابع پوشش میدهند، مشخص نگهداشتن درخواستها بهجای باز گذاشتن آنها، و رفتار با استنادها، اعداد و جزئیات مشخص خود مدل بهعنوان ادعاهایی برای راستیآزمایی، نه حقایقی که از قبل بررسی شدهاند. ترکیب تکنیکها — زمینهسازی بههمراه مقایسهٔ چند مدل بههمراه راستیآزمایی در برابر یک منبع — بیش از هر کدام بهتنهایی سطح خطا را کاهش میدهد.
چرا کاهش تصادفیبودن مشکل را حل نمیکند
فرض رایجی وجود دارد که پایینآوردن دما (ببینید دما و top-p) مدل را صادقتر میکند، چون خروجی محتاطانهتر و قطعیتر بهنظر میرسد. دما تعیین میکند مدل چگونه از میان توکنهای محتمل بعدی نمونهبرداری کند — چیزی را که مدل میداند تغییر نمیدهد و مرحلهای برای بررسی صحت اضافه نمیکند. مدل میتواند در دمای صفر دقیقاً با همان اطمینان دمای یک توهم بزند؛ تنظیم پایینتر فقط باعث میشود همان پاسخ نادرست را با ثبات بیشتری تکرار کند.
پرسشهای پرتکرار
- آیا میتوان توهم را کاملاً برطرف کرد؟
- نه، نه با معماریهای کنونی مدلهای زبانی. این پدیده از نحوهٔ تولید متن این مدلها میآید — پیشبینی ادامهٔ محتمل بهجای بررسی حقایق — پس میتوان آن را با زمینهسازی، مقایسهٔ چند مدل و راستیآزمایی کاهش داد، اما نمیتوان بهعنوان یک دسته کاملاً حذفش کرد.
- آیا مدل بزرگتر یا جدیدتر کمتر توهم میزند؟
- اغلب در دانش رایج کمتر، چون بخش بیشتری از آن در آموزش بهخوبی نمایش داده شده. اما این سازوکار زیربنایی را حذف نمیکند — یک مدل جدیدتر همچنان میتواند در جزئیات کمیاب، خاص یا اخیری که بهخوبی روی آنها آموزش ندیده، با اطمینان توهم بزند.
- آیا توهم همان دروغگفتن مدل است؟
- نه. دروغگفتن یعنی دانستن حقیقت و گفتن چیز دیگری. مدل کانال جداگانهای برای «حقیقت» ندارد که خروجیاش را با آن بسنجد — محتملترین ادامه را از نظر آماری تولید میکند، چه درست از آب دربیاید چه نه.
- آیا دادن اسناد خودتان به مدل جلوی توهم را میگیرد؟
- برای پرسشهایی که آن اسناد واقعاً پاسخ میدهند، بهطور چشمگیری کاهشش میدهد، چون مدل میتواند متن بازیابیشده را بازگو کند، نه اینکه فقط از دادههای آموزشی پیشبینی کند. اما مانع نمیشود که مدل، وقتی بازیابی چیز مرتبطی پیدا نمیکند، روان از حافظه پاسخ دهد.
بهجای خواندن، امتحانش کنید
ClawAI ادعا نمیکند توهم را حذف میکند — هیچ محصولی صادقانه نمیتواند چنین ادعایی داشته باشد. آنچه ارائه میدهد، کاهشدهندههایی است که آن را بهشکل قابلسنجش محدود میکنند: پاسخهای مبتنی بر بازیابی که در اسناد خود شما ریشه دارند (ببینید RAG چیست)، اجماع چندمدلی که اختلاف میان مدلها را آشکار میکند (ببینید اجماع هوش مصنوعی چیست)، و داور هوش مصنوعی که پاسخها را بر اساس معیارهای مشخص نمره میدهد (ببینید داور هوش مصنوعی چیست) — سه ویژگی واقعی و مستقل، هر کدام یک فیلتر جزئی، نه یک تضمین.