Проблема локализации ошибок в RAG
В системах Retrieval-Augmented Generation (RAG) галлюцинации редко охватывают весь ответ целиком. Чаще всего они возникают в локализованных фрагментах текста. Традиционные методы оценки часто оценивают документ целиком, что приводит к ложным срабатываниям, если часть ответа корректна. Новая работа предлагает подход CORTEX, который позволяет выявлять не подтвержденные фактами токены с высокой точностью.
Механизм работы: сравнение представлений
Ключевая идея CORTEX заключается в анализе того, насколько сильно каждый токен зависит от извлеченных документов. Метод сравнивает внутренние представления (internal representations) большой языковой модели (LLM) в двух условиях:
- С контекстом: модель генерирует ответ, используя retrieved-документы.
- Без контекста: модель генерирует ответ без доступа к документам (или с пустым контекстом).
Разница между этими состояниями позволяет выявить токены, которые «выдуманы» моделью, а не заимствованы из источника. Кроме того, CORTEX учитывает распространение информации через предыдущие токены, что снижает количество ложноположительных результатов для токенов, чьи доказательства уже усвоены контекстом.
Постобработка и сглаживание
Для устранения локального шума метод применяет шаг постобработки, который моделирует тенденцию меток галлюцинаций сохраняться в смежных диапазонах (spans). Это обеспечивает согласованность предсказаний и предотвращает фрагментарные ошибки детекции.
Результаты экспериментов
Тестирование проводилось на двух бенчмарках RAG с использованием трех различных LLM. Результаты показывают, что CORTEX существенно улучшает качество детекции галлюцинаций на уровне токенов. Каждый компонент архитектуры (сравнение представлений, учет распространения информации и сглаживание) вносит вклад в общий прирост метрик.
| Компонент CORTEX | Функция | Влияние на результат |
|---|---|---|
| Сравнение представлений | Анализ влияния документов на токены | Базовая детекция негрундированного контента |
| Учет распространения | Анализ предыдущих токенов | Снижение ложноположительных срабатываний |
| Постобработка (Smoothing) | Моделирование смежных диапазонов | Устранение локального шума, согласованность |
Значение для индустрии
Разработка CORTEX открывает путь к созданию более надежных RAG-систем, способных не только генерировать ответы, но и точно маркировать их достоверность на уровне отдельных слов. Это критически важно для применения LLM в сферах, требующих высокой точности фактов (медицина, юриспруденция, финансы).
Источник: arXiv cs.CL ↗
