Исследования2 октября 2026 г., 03:17 МСК🤖 Auto

Конформный контроль фактов для Multi-Hop RAG: точность 97% ценой отказа от 69% ответов

Исследователи применили метод конформного прогнозирования к многоступенчатой генерации с извлечением данных (Multi-Hop RAG), достигнув 97% гарантии фактологической точности, но столкнувшись с высоким уровнем отказа моделей от ответа.

Баннер новости 8739

Проблема Multi-Hop RAG и гипотеза

Системы Retrieval-Augmented Generation (RAG) часто сталкиваются с проблемой «галлюцинаций», когда сгенерированный ответ не полностью поддерживается извлеченным контекстом. Эта проблема усугубляется в сценариях Multi-Hop RAG, где модель должна последовательно извлекать и рассуждать на основе нескольких порций данных. Авторы исследования (Muhammad Aimal Rehman и Chi-Kuang Yeh) проверили, остается ли эффективным claim-level conformal factuality control (контроль фактологичности на уровне утверждений) в таких сложных цепочках.

Методология и инструменты

Для проверки гипотезы использовался метод split-conformal claim filtering. Эксперимент проводился на двух популярных моделях — Llama 3.1 8B и GPT-4o-mini — в трех ключевых бенчмарках для многоступенчатых вопросов: HotpotQA, Natural Questions и TriviaQA. Также был проведен референсный эксперимент с одношаговым RAG для сравнения.

Ключевые метрики: Точность против Доступности

Результаты демонстрируют сильный компромисс между надежностью и полезностью. При установке целевого уровня достоверности на 95%, доля ответов, чьи утверждения полностью подтверждены фактами, возрастает с базовых 55–76% до 95–97%. Однако цена этого качества — радикальное сокращение объема выдаваемой информации. Модель начинает массово отказываться от генерации ответа, если не может гарантировать 100% поддержку каждого факта.

Метрика Без фильтрации (Baseline) С конформным контролем (95% target)
Доля полностью подтвержденных утверждений 55.60% – 76.03% 95.80% – 97.20%
Доля сохраненных утверждений (Retention) 100% (все сгенерированные) 4.41% – 31.09%
Доля непустых ответов (Non-empty responses) 100% 9.70% – 51.40%

Почему это важно для индустрии

Исследование доказывает, что конформный контроль масштабируется на сложные многоступенчатые сценарии, но требует пересмотра метрик надежности. «Номинальная надежность» (например, заявленные 95%) не должна рассматриваться изолированно. Для внедрения таких систем в продакшн необходимо совместно оценивать claim retention (сколько фактов осталось в ответе) и abstention (как часто модель молчит). Высокий процент отказов (до 90% ответов могут быть отброшены) указывает на необходимость тонкой настройки порога уверенности для баланса между точностью и пользовательским опытом.

Источник: arXiv cs.CL ↗