Исследования7 сентября 2026 г., 19:19 МСК🤖 Auto

LLM не верифицируют, а интегрируют: 10 млн тестов раскрыли механизм RAG

Исследование Kawada и Kellis (arXiv:2609.04290) опровергает идею, что LLM логически проверяют внешние данные. На 10 млн примеров показано: модели просто смешивают ответы, игнорируя внутреннюю верификацию.

Баннер новости 6952

Суть открытия: Интеграция вместо проверки

Традиционно считается, что Large Language Models (LLM) в режимах RAG (Retrieval-Augmented Generation) или при работе с агентами сначала анализируют предоставленные факты, а затем формируют ответ. Авторы исследования, проведенного Себастьеном Кавадой и Маноллисом Келлисом, доказали обратное: интеграция внешних доказательств — это не логический процесс верификации, а политика управления распределением.

Модель не «проверяет» источник на истинность. Вместо этого она сдвигает распределение своих первоначальных ответов под влиянием внешнего сигнала. Этот процесс описывается формулой, где ключевую роль играют вес первоначального ответа получателя (receiver prior weight) и наклон кандидата (candidate evidence tilt). Проще говоря, модель просто «подтягивает» свой ответ к предложенному варианту, даже если внутренняя проверка показала его ошибочность.

Три главных предсказания и их подтверждение

Исследователи провели более 10 миллионов испытаний с участием 12 моделей от четырех разных семейств в восьми различных доменах, включая сложные научные задачи (квантовая механика, генетика, молекулярная биология). Были подтверждены три ключевых гипотезы:

  • Эффект убеждения: Кандидаты, которые изначально более вероятны для модели, оказываются более убедительными.
  • Собственные ошибки: Модели охотнее интегрируют характерные ошибки своих собственных распределений, чем чужие ошибки из внешних источников.
  • Парадокс силы: Идентичное внешнее доказательство может улучшить результаты слабых моделей, но навредить сильным, так как сильные модели имеют более узкое и уверенное первоначальное распределение.

Цифры, которые пугают: 99.4% интеграции ложных фактов

Самый тревожный результат касается способности моделей к верификации. Исследователи использовали пропозициональные ограничения для проверки недействительности внешних кандидатов. Оказалось, что LLM интегрируют ложные кандидаты даже после того, как внутренне подтвердили их несостоятельность.

Метрика / Условие Результат интеграции Значение для индустрии
Интеграция с пропозициональными ограничениями 93–100% Модели игнорируют явные логические противоречия
Интеграция на тестовой выборке (физика/биология) до 99.4% Высокая надежность эффекта в сложных доменах
Влияние представлений верификации Минимальное Состояние «проверки» не влияет на финальный ответ

Почему это важно для разработчиков AI

Результаты показывают, что интеграция кандидатов реализуется на поздних этапах работы сети как структурированная последовательность шагов: принятие внешнего кандидата, его продвижение и перенос в состояние ответа. Представления верификации (decodable verification) существуют, но имеют мало причинно-следственного влияния на итоговый ответ.

Это означает, что текущие подходы к повышению надежности LLM через простую «подсказку» фактов могут быть неэффективны. Нам нужно пересматривать архитектуру контроля: вместо того чтобы полагаться на то, что модель «поймет» контекст, необходимо внедрять жесткие механизмы разделения состояний верификации и генерации ответа, так как в текущем виде эти процессы полностью диссоциированы.

Источник: arXiv cs.CL ↗