به محتوای اصلی بروید

مبانی

چرا هوش مصنوعی توهم می‌زند؟

یک مدل زبانی پاسخی نادرست را با همان لحن مطمئنی بیان می‌کند که پاسخی درست را، چون هرگز آموزش ندیده که بداند چه چیزی را نمی‌داند. چرا توهم رخ می‌دهد، چرا نمی‌توان آن را کاملاً حذف کرد، و چه چیزی واقعاً آن را کاهش می‌دهد.

همهٔ توضیح‌ها · آخرین بازبینی:

این یک پاسخ نادرستِ مطمئن است، نه خطایی که مدل بتواند گزارش دهد

مدل حالت جداگانه‌ای برای «نمی‌دانم» ندارد که به آن برگردد. هر پاسخ، درست یا نادرست، از همان فرایند پیش‌بینی توکن بعدی می‌آید، پس یک استناد ساختگی یا یک متد API که وجود ندارد با همان اطمینان روان یک پاسخ درست خوانده می‌شود. همین چیزی است که توهم را از یک باگ نرم‌افزاری معمولی متفاوت می‌کند — هیچ استثنایی پرتاب نمی‌شود، هیچ پرچمی بالا نمی‌رود، چیزی برای گرفتن وجود ندارد. خروجی چه درست باشد چه نادرست، دقیقاً به همان اندازه قابل‌اعتماد به نظر می‌رسد.

چرا رخ می‌دهد: پیش‌بینی، نه جست‌وجو

مدل زبانی آموزش دیده تا ادامهٔ محتمل متن را پیش‌بینی کند، بر اساس الگوهایی که از داده‌های آموزشی‌اش یاد گرفته. برخلاف پایگاه‌داده، حقایق را به شکلی بازیابی‌پذیر و قابل‌راستی‌آزمایی ذخیره نمی‌کند — شکل آماری زبان را ذخیره می‌کند، از جمله حقایقی که در آموزش به‌اندازهٔ کافی رایج بوده‌اند تا آن شکل را بسازند. وقتی پرامپتی چیزی می‌خواهد که مدل کم دیده، ناهماهنگ دیده یا اصلاً ندیده، مدل از پاسخ‌دادن کوتاهی نمی‌کند؛ به‌هرحال محتمل‌ترین ادامه را تولید می‌کند، چون تنها کاری است که بلد است.

همین موضوع توضیح می‌دهد چرا توهم با جزئیات خاص، کمیاب یا اخیر بدتر می‌شود — پرونده‌ای قضایی که واقعی به‌نظر می‌رسد اما ساختگی است، شمارهٔ نسخه‌ای محتمل اما نادرست، استنادی که مثل عنوان یک مقالهٔ واقعی به‌نظر می‌رسد. هرچه ادعا خاص‌تر باشد، احتمال بیشتری دارد که مدل یک شکاف را با چیزی صرفاً محتمل پر کند، نه چیزی که واقعاً می‌داند.

زمینه‌سازی شکاف را کوچک می‌کند، نه اینکه ببندد

قراردادن متن منبع واقعی جلوی مدل پیش از پاسخ‌دادن — بازیابی، ببینید RAG چیست — توهم را در پرسش‌هایی که آن منابع واقعاً پوشش می‌دهند، به‌شکل قابل‌سنجش کاهش می‌دهد، چون مدل می‌تواند آنچه تازه خوانده را بازگو کند، نه اینکه فقط از داده‌های آموزشی پیش‌بینی کند. اما این یک تمایل قوی است، نه یک تضمین: اگر بازیابی چیز مفیدی برنگرداند، یا منابع ناقص باشند، مدل همچنان می‌تواند روان از حافظه پاسخ دهد، به‌جای اینکه بپذیرد منابع کمکی نکرده‌اند.

مقایسهٔ چند مدل یک فیلتر است، نه درمان

پرسیدن یک سؤال یکسان از چند مدل و مقایسهٔ پاسخ‌ها، توهم‌هایی را می‌گیرد که مخصوص آموزش یا ویژگی‌های یک مدل هستند — اگر فقط یکی از سه مدل جزئیاتی را بسازد، آن اختلاف یک سیگنال است. اما توهمی را که اکثر مدل‌ها مشترکاً دارند نمی‌گیرد، چون داده‌های آموزشی میان ارائه‌دهندگان همپوشانی دارند. همین محدودیت دربارهٔ استفاده از یک مدل جدا به‌عنوان داور برای نمره‌دادن به پاسخ هم صدق می‌کند: مدل داور می‌تواند فریب همان نوع متن روان، مطمئن و نادرستی را بخورد که قرار است بررسی‌اش کند.

چه چیزی واقعاً در عمل توهم را کاهش می‌دهد

هیچ تکنیک واحدی توهم را حذف نمی‌کند، چون این یک ویژگی از نحوهٔ تولید متن این مدل‌هاست، نه یک اشکال مخصوص یک مدل یا ارائه‌دهنده. آنچه واقعاً کمک می‌کند، محدودکردن وظیفهٔ مدل است: مبتنی‌کردن پاسخ‌ها بر متن منبع بازیابی‌شده برای پرسش‌هایی که منابع پوشش می‌دهند، مشخص نگه‌داشتن درخواست‌ها به‌جای باز گذاشتن آن‌ها، و رفتار با استنادها، اعداد و جزئیات مشخص خود مدل به‌عنوان ادعاهایی برای راستی‌آزمایی، نه حقایقی که از قبل بررسی شده‌اند. ترکیب تکنیک‌ها — زمینه‌سازی به‌همراه مقایسهٔ چند مدل به‌همراه راستی‌آزمایی در برابر یک منبع — بیش از هر کدام به‌تنهایی سطح خطا را کاهش می‌دهد.

چرا کاهش تصادفی‌بودن مشکل را حل نمی‌کند

فرض رایجی وجود دارد که پایین‌آوردن دما (ببینید دما و top-p) مدل را صادق‌تر می‌کند، چون خروجی محتاطانه‌تر و قطعی‌تر به‌نظر می‌رسد. دما تعیین می‌کند مدل چگونه از میان توکن‌های محتمل بعدی نمونه‌برداری کند — چیزی را که مدل می‌داند تغییر نمی‌دهد و مرحله‌ای برای بررسی صحت اضافه نمی‌کند. مدل می‌تواند در دمای صفر دقیقاً با همان اطمینان دمای یک توهم بزند؛ تنظیم پایین‌تر فقط باعث می‌شود همان پاسخ نادرست را با ثبات بیشتری تکرار کند.

پرسش‌های پرتکرار

آیا می‌توان توهم را کاملاً برطرف کرد؟
نه، نه با معماری‌های کنونی مدل‌های زبانی. این پدیده از نحوهٔ تولید متن این مدل‌ها می‌آید — پیش‌بینی ادامهٔ محتمل به‌جای بررسی حقایق — پس می‌توان آن را با زمینه‌سازی، مقایسهٔ چند مدل و راستی‌آزمایی کاهش داد، اما نمی‌توان به‌عنوان یک دسته کاملاً حذفش کرد.
آیا مدل بزرگ‌تر یا جدیدتر کمتر توهم می‌زند؟
اغلب در دانش رایج کمتر، چون بخش بیشتری از آن در آموزش به‌خوبی نمایش داده شده. اما این سازوکار زیربنایی را حذف نمی‌کند — یک مدل جدیدتر همچنان می‌تواند در جزئیات کمیاب، خاص یا اخیری که به‌خوبی روی آن‌ها آموزش ندیده، با اطمینان توهم بزند.
آیا توهم همان دروغ‌گفتن مدل است؟
نه. دروغ‌گفتن یعنی دانستن حقیقت و گفتن چیز دیگری. مدل کانال جداگانه‌ای برای «حقیقت» ندارد که خروجی‌اش را با آن بسنجد — محتمل‌ترین ادامه را از نظر آماری تولید می‌کند، چه درست از آب دربیاید چه نه.
آیا دادن اسناد خودتان به مدل جلوی توهم را می‌گیرد؟
برای پرسش‌هایی که آن اسناد واقعاً پاسخ می‌دهند، به‌طور چشمگیری کاهشش می‌دهد، چون مدل می‌تواند متن بازیابی‌شده را بازگو کند، نه اینکه فقط از داده‌های آموزشی پیش‌بینی کند. اما مانع نمی‌شود که مدل، وقتی بازیابی چیز مرتبطی پیدا نمی‌کند، روان از حافظه پاسخ دهد.

به‌جای خواندن، امتحانش کنید

ClawAI ادعا نمی‌کند توهم را حذف می‌کند — هیچ محصولی صادقانه نمی‌تواند چنین ادعایی داشته باشد. آنچه ارائه می‌دهد، کاهش‌دهنده‌هایی است که آن را به‌شکل قابل‌سنجش محدود می‌کنند: پاسخ‌های مبتنی بر بازیابی که در اسناد خود شما ریشه دارند (ببینید RAG چیست)، اجماع چندمدلی که اختلاف میان مدل‌ها را آشکار می‌کند (ببینید اجماع هوش مصنوعی چیست)، و داور هوش مصنوعی که پاسخ‌ها را بر اساس معیارهای مشخص نمره می‌دهد (ببینید داور هوش مصنوعی چیست) — سه ویژگی واقعی و مستقل، هر کدام یک فیلتر جزئی، نه یک تضمین.