Перейти к основному содержимому

Основы

Почему ИИ галлюцинирует?

Языковая модель заявляет неверный ответ тем же уверенным тоном, что и верный, потому что её никогда не учили знать, чего она не знает. Почему возникают галлюцинации, почему их нельзя устранить полностью и что на самом деле их снижает.

Все разборы · Последняя проверка:

Это уверенный неверный ответ, а не ошибка, которую модель может распознать

У модели нет отдельного режима «я не знаю», в который можно переключиться. Любой ответ, верный или нет, рождается из одного и того же процесса предсказания следующего токена, поэтому выдуманная цитата или несуществующий метод API звучат с той же беглой уверенностью, что и верный ответ. Именно это отличает галлюцинацию от обычной программной ошибки — не выбрасывается исключение, не поднимается флаг, нечего перехватывать. Результат выглядит одинаково надёжным, верен он или нет.

Почему это происходит: предсказание, а не поиск

Языковая модель обучена предсказывать правдоподобные продолжения текста, выученные по закономерностям в её обучающих данных. Она не хранит факты в извлекаемой и проверяемой форме, как база данных, — она хранит статистическую форму языка, включая факты, встречавшиеся в обучении достаточно часто, чтобы эту форму сформировать. Когда промпт просит о чём-то, что модель видела редко, противоречиво или никогда, модель не отказывается отвечать — она всё равно выдаёт самое правдоподобное продолжение, потому что это единственное, что она умеет делать.

Это же объясняет, почему галлюцинации усиливаются на конкретных, редких или недавних деталях — судебное дело, звучащее реалистично, но выдуманное, правдоподобный, но неверный номер версии, цитата, звучащая как название настоящей статьи. Чем конкретнее утверждение, тем выше вероятность, что модель заполняет пробел чем-то просто правдоподобным, а не известным.

Обоснование сужает разрыв, но не устраняет его

Предоставление модели реального исходного текста перед ответом — извлечение, см. что такое RAG — измеримо снижает галлюцинации по вопросам, которые эти источники действительно покрывают, потому что модель может пересказать только что прочитанное, а не предсказывать исключительно по обучающим данным. Но это сильная тенденция, а не гарантия: если извлечение не находит ничего полезного или источники неполны, модель всё равно может бегло ответить по памяти, вместо того чтобы признать, что источники не помогли.

Сверка нескольких моделей — это фильтр, а не лекарство

Задавание одного и того же вопроса нескольким моделям и сравнение ответов улавливает галлюцинации, специфичные для обучения или особенностей одной модели — если только одна из трёх моделей выдумывает деталь, это расхождение служит сигналом. Но это не улавливает галлюцинацию, которую разделяет большинство моделей, потому что обучающие данные разных провайдеров пересекаются. То же ограничение касается использования отдельной модели в роли судьи для оценки ответа: модель-судья может быть обманута тем же типом беглого, уверенного и неверного текста, который она должна проверять.

Что реально снижает галлюцинации на практике

Ни один отдельный приём не устраняет галлюцинации, потому что это свойство того, как эти модели генерируют текст, а не дефект конкретной модели или провайдера. Измеримо помогает сужение задачи модели: обоснование ответов на извлечённом исходном тексте для вопросов, которые покрывают источники, сохранение конкретности запросов вместо расплывчатости, и отношение к собственным цитатам, числам и конкретным деталям модели как к утверждениям, требующим проверки, а не как к уже проверенным фактам. Сочетание приёмов — обоснование, сверка моделей и проверка по источнику — снижает поле для ошибки сильнее, чем любой из них по отдельности.

Почему снижение случайности не решает проблему

Распространено мнение, что понижение температуры (см. температура и top-p) делает модель более правдивой, потому что вывод выглядит осторожнее и детерминированнее. Температура определяет, как модель выбирает среди вероятных следующих токенов — она не меняет то, что модель знает, и не добавляет проверку фактов. Модель может галлюцинировать при нулевой температуре с той же уверенностью, что и при единице; более низкая настройка лишь заставляет её повторять один и тот же неверный ответ более стабильно.

Частые вопросы

Можно ли полностью устранить галлюцинации?
Нет, не с нынешними архитектурами языковых моделей. Они возникают из того, как эти модели генерируют текст — предсказывая правдоподобные продолжения вместо проверки фактов, — поэтому их можно снизить обоснованием, сверкой моделей и проверкой, но не устранить как категорию.
Галлюцинирует ли более крупная или новая модель меньше?
Часто меньше в области общих знаний, потому что бо́льшая их часть была хорошо представлена в обучении. Это не устраняет базовый механизм — новая модель всё равно может уверенно галлюцинировать по редким, конкретным или недавним деталям, на которых её плохо обучили.
Это то же самое, что и ложь модели?
Нет. Ложь предполагает знание правды и заявление обратного. У модели нет отдельного канала для «правды», с которым можно сверить свой вывод, — она генерирует статистически наиболее правдоподобное продолжение независимо от того, оказывается оно точным или нет.
Останавливает ли галлюцинации предоставление модели своих документов?
Это значительно снижает их по вопросам, на которые эти документы действительно отвечают, потому что модель может пересказать извлечённый текст, а не предсказывать исключительно по обучающим данным. Это не мешает модели бегло отвечать по памяти, когда извлечение не находит ничего релевантного.

Лучше попробовать, чем читать

ClawAI не заявляет, что устраняет галлюцинации — ни один продукт не может честно это утверждать. Он предлагает меры, измеримо их сужающие: ответы на основе извлечения, обоснованные вашими собственными документами (см. что такое RAG), консенсус нескольких моделей, выявляющий расхождения между ними (см. что такое консенсус ИИ), и судью ИИ, оценивающего ответы по заданным критериям (см. что такое судья ИИ) — три реальные независимые функции, каждая из которых является лишь частичным фильтром, а не гарантией.