Новый взгляд на проблему галлюцинаций
Традиционно считается, что фактические галлюцинации в задачах закрытого вопроса (closed-book QA) возникают из-за того, что нужная информация просто отсутствует во внутренней памяти модели. Однако новая работа Xi Wang, Shijia Xu и Rongfeng Guo (arXiv:2609.12111, сентябрь 2026) вводит критически важное уточнение: даже если факт был усвоен, конечный объем памяти вынуждает модель хранить его приближенно. Это приводит к потере точности при воспроизведении.
Информационно-теоретическая модель
Авторы разработали модель, где обучающая выборка состоит из M фактов, которые сжимаются до B бит. При ответе на случайный запрос из N возможных вариантов и K возможных ответов, ошибка возникает по двум причинам: неполное покрытие (факт не был изучен) и искажение сжатия (факт был изучен, но «сжат» с потерями).
Формула предела ошибок
Ключевым результатом является вывод нижнего предела ошибки ε, который разделяет влияние недостатка данных и влияние сжатия:
| Компонент ошибки | Математическое выражение | Смысл |
|---|---|---|
| Потери от сжатия | $\frac{M}{N}\delta^\star(\frac{B}{M})$ | Ошибка из-за того, что известные факты хранятся с потерями точности (B бит на M фактов) |
| Отсутствие знаний | $(1-\frac{M}{N})(1-\frac{1}{K})$ | Ошибка из-за того, что факт вообще не был в обучающей выборке |
Где $\delta^\star(r)$ — обратная функция скорости-искажения для равномерного K-арного источника при нулевой потере.
Практические следствия для индустрии
Исследование показывает, что простое увеличение объема данных (M) не решает проблему галлюцинаций полностью, если пропускная способность памяти (B) не растет синхронно. Авторы провели симуляции и тесты на современных языковых моделях, варьируя нагрузку фактами и эффективный объем обучаемой памяти. Результаты подтверждают, что выборочная память (selective memory) и воздержание от ответа (abstention) являются необходимыми механизмами для минимизации ошибок, вызванных вынужденным сжатием.
Почему это важно
Работа предлагает не просто описание проблемы, а строгий информационно-теоретический инструмент для оценки надежности LLM. Понимание того, что галлюцинация — это часто результат «потери качества» при хранении, а не просто «отсутствия факта», меняет подход к оптимизации архитектур памяти и механизмам извлечения знаний (retrieval-augmented generation).
Источник: arXiv cs.CL ↗
