Исследования1 июля 2026 г., 23:18 МСК🤖 Auto

CORTEX: Токен-уровневый детектор галлюцинаций в RAG

Исследователи представили CORTEX — метод выявления галлюцинаций в RAG-системах на уровне отдельных токенов через сравнение внутренних представлений модели с контекстом и без него.

Баннер новости 2768

Проблема локализации ошибок в RAG

В системах Retrieval-Augmented Generation (RAG) галлюцинации редко охватывают весь ответ целиком. Чаще всего они возникают в локализованных фрагментах текста. Традиционные методы оценки часто оценивают документ целиком, что приводит к ложным срабатываниям, если часть ответа корректна. Новая работа предлагает подход CORTEX, который позволяет выявлять не подтвержденные фактами токены с высокой точностью.

Механизм работы: сравнение представлений

Ключевая идея CORTEX заключается в анализе того, насколько сильно каждый токен зависит от извлеченных документов. Метод сравнивает внутренние представления (internal representations) большой языковой модели (LLM) в двух условиях:

  • С контекстом: модель генерирует ответ, используя retrieved-документы.
  • Без контекста: модель генерирует ответ без доступа к документам (или с пустым контекстом).

Разница между этими состояниями позволяет выявить токены, которые «выдуманы» моделью, а не заимствованы из источника. Кроме того, CORTEX учитывает распространение информации через предыдущие токены, что снижает количество ложноположительных результатов для токенов, чьи доказательства уже усвоены контекстом.

Постобработка и сглаживание

Для устранения локального шума метод применяет шаг постобработки, который моделирует тенденцию меток галлюцинаций сохраняться в смежных диапазонах (spans). Это обеспечивает согласованность предсказаний и предотвращает фрагментарные ошибки детекции.

Результаты экспериментов

Тестирование проводилось на двух бенчмарках RAG с использованием трех различных LLM. Результаты показывают, что CORTEX существенно улучшает качество детекции галлюцинаций на уровне токенов. Каждый компонент архитектуры (сравнение представлений, учет распространения информации и сглаживание) вносит вклад в общий прирост метрик.

Компонент CORTEX Функция Влияние на результат
Сравнение представлений Анализ влияния документов на токены Базовая детекция негрундированного контента
Учет распространения Анализ предыдущих токенов Снижение ложноположительных срабатываний
Постобработка (Smoothing) Моделирование смежных диапазонов Устранение локального шума, согласованность

Значение для индустрии

Разработка CORTEX открывает путь к созданию более надежных RAG-систем, способных не только генерировать ответы, но и точно маркировать их достоверность на уровне отдельных слов. Это критически важно для применения LLM в сферах, требующих высокой точности фактов (медицина, юриспруденция, финансы).

Источник: arXiv cs.CL ↗