Исследования31 августа 2026 г., 11:17 МСК🤖 Auto

RAG-триаж: как декодировать скрытые слои LLM для точного ответа

Исследователи из COLM 2026 представили метод «Knowing Before Answering», позволяющий LLM самостоятельно определять, достаточно ли контекста для ответа, избегая галлюцинаций.

Баннер новости 6403

Проблема неопределенности в RAG

В системах Retrieval-Augmented Generation (RAG) критическая ошибка — это выдача ответа на основе недостаточных или противоречивых данных. Авторы работы (Syed Mahbubul Huq, Christopher Child, Tillman Weyde, Pranava Madhyastha) предлагают решить эту проблему не через внешние проверки, а через анализ внутренних состояний самой языковой модели. Задача формулируется как трехклассовая классификация: модель должна определить, является ли предоставленная информация достаточной, недостаточной или противоречивой.

Методология: чтение «мыслей» модели

Вместо того чтобы полагаться на промпты или дообучение всей сети, исследователи извлекли признаки из скрытых активаций (hidden activations) и внимания (attention-derived features). На этих данных обучена легковесная линейная модель-маршрутизатор (router). Этот подход позволяет «считывать» уверенность модели до генерации финального ответа.

Результаты на 16 моделях

Эксперименты проводились на 16 различных языковых моделях разного размера и архитектуры. Был создан контролируемый бенчмарк с фиктивными данными, где каждый пример был помечен как «ответимый», «недостаточно информации» или «конфликт». Предложенный метод на основе внутренних сигналов стабильно превосходит базовые подходы на основе промптинга и специализированные RAG-модели.

Критерий сравнения Результат метода «Knowing Before Answering» Примечание
Источник данных Скрытые активации (middle layers) Более эффективны, чем выходы MLP или значения внимания
Масштабируемость 16 моделей разных архитектур Метод универсален для разных семейств LLM
Конкурентное преимущество Превосходство над промптами Выше точность классификации состояний контекста

Почему это важно для индустрии

Исследование демонстрирует, что языковые модели внутренне кодируют информацию о достаточности доказательной базы. Это открывает путь к созданию надежных систем «триажа» (сортировки запросов), которые будут отказываться от ответа или запрашивать уточнения, когда контекст слаб, вместо того чтобы генерировать убедительный, но ложный ответ. Метод принят к публикации на Third Conference on Language Modeling (COLM 2026).

Источник: arXiv cs.CL ↗