Проблема Multi-Hop RAG и гипотеза
Системы Retrieval-Augmented Generation (RAG) часто сталкиваются с проблемой «галлюцинаций», когда сгенерированный ответ не полностью поддерживается извлеченным контекстом. Эта проблема усугубляется в сценариях Multi-Hop RAG, где модель должна последовательно извлекать и рассуждать на основе нескольких порций данных. Авторы исследования (Muhammad Aimal Rehman и Chi-Kuang Yeh) проверили, остается ли эффективным claim-level conformal factuality control (контроль фактологичности на уровне утверждений) в таких сложных цепочках.
Методология и инструменты
Для проверки гипотезы использовался метод split-conformal claim filtering. Эксперимент проводился на двух популярных моделях — Llama 3.1 8B и GPT-4o-mini — в трех ключевых бенчмарках для многоступенчатых вопросов: HotpotQA, Natural Questions и TriviaQA. Также был проведен референсный эксперимент с одношаговым RAG для сравнения.
Ключевые метрики: Точность против Доступности
Результаты демонстрируют сильный компромисс между надежностью и полезностью. При установке целевого уровня достоверности на 95%, доля ответов, чьи утверждения полностью подтверждены фактами, возрастает с базовых 55–76% до 95–97%. Однако цена этого качества — радикальное сокращение объема выдаваемой информации. Модель начинает массово отказываться от генерации ответа, если не может гарантировать 100% поддержку каждого факта.
| Метрика | Без фильтрации (Baseline) | С конформным контролем (95% target) |
|---|---|---|
| Доля полностью подтвержденных утверждений | 55.60% – 76.03% | 95.80% – 97.20% |
| Доля сохраненных утверждений (Retention) | 100% (все сгенерированные) | 4.41% – 31.09% |
| Доля непустых ответов (Non-empty responses) | 100% | 9.70% – 51.40% |
Почему это важно для индустрии
Исследование доказывает, что конформный контроль масштабируется на сложные многоступенчатые сценарии, но требует пересмотра метрик надежности. «Номинальная надежность» (например, заявленные 95%) не должна рассматриваться изолированно. Для внедрения таких систем в продакшн необходимо совместно оценивать claim retention (сколько фактов осталось в ответе) и abstention (как часто модель молчит). Высокий процент отказов (до 90% ответов могут быть отброшены) указывает на необходимость тонкой настройки порога уверенности для баланса между точностью и пользовательским опытом.
Источник: arXiv cs.CL ↗
