Суть проблемы: отравление через экстремальные значения
Крупные языковые модели (LLM) способны обрабатывать огромные объемы текста, но их способность находить и использовать решающие доказательства деградирует при добавлении нерелевантного или запутывающего контекста. Авторы статьи, опубликованной в arXiv 12 августа 2026 года, называют это явление «контекстным отравлением» (Context Poisoning).
Феномен объясняется через призму экстремальной интерференции в механизме внимания (extreme-value attention interference). Суть в следующем: балл (score) за решающее доказательство имеет верхнюю границу, тогда как максимальный балл среди эффективных «дистракторов» (отвлекающих факторов) растет по мере их увеличения. Это приводит к тому, что модель начинает реагировать на шум, а не на суть.
Математическая граница точности
В рамках абстракции извлечения данных через softmax (softmax retrieval abstraction) исследователи вывели верхнюю границу для конечной выборки. Они показали, что для поддержания целевой точности выше базового уровня, разрыв между доказательством и дистракторами (evidence margin) должен масштабироваться как $\Omega(\sqrt{\log N})$.
Важно отметить, что $N$ обозначает количество эффективных дистракторов, а не обязательно сырую длину контекста. Это означает, что проблема кроется не в объеме текста, а в количестве «опасных» для внимания фрагментов.
Ключевые метрики и выводы экспериментов
Контролируемые эксперименты подтвердили теоретические выкладки. Ниже приведены основные результаты влияния различных факторов на точность извлечения (retrieval accuracy):
| Фактор воздействия | Наблюдаемый эффект | Причина (по авторам) |
|---|---|---|
| Рост общего контекста | Снижение точности извлечения | Наличие встроенных «hard negatives» (сложных отрицательных примеров) |
| Одинаковый формат дистракторов | Наибольшее падение точности | Синтаксическое сходство усиливает интерференцию внимания |
| Использование gating (вентилирования) | Улучшение использования доказательств | Эффективность зависит от сохранения полноты извлечения (recall) |
Три механизма деградации
Авторы связывают деградацию длинного контекста с тремя конкретными явлениями:
- Score aliasing: Схожие баллы у разных токенов, что затрудняет выделение главного.
- Positional aliasing: Потеря позиционной информации в длинных последовательностях.
- Softmax dilution: Разбавление вероятностного распределения из-за большого количества токенов.
Пути решения
На основе полученных данных исследователи предлагают несколько архитектурных решений для борьбы с контекстным отравлением:
- Evidence bottlenecks: Создание узких мест для доказательств, чтобы изолировать их от шума.
- Alias-resistant representations: Представления, устойчивые к псевдонимам (алиасам) в данных.
- Retrieve-then-reason: Архитектуры, где сначала происходит поиск, а затем рассуждение.
- Verifier-mediated memory: Память, опосредованная верификатором.
- Contrastive anti-poison training: Контрастивное обучение, направленное на защиту от отравления.
Источник: arXiv cs.CL ↗
