Проблема оценки систем Retrieval-Augmented Generation (RAG) заключается в их зависимости от контекста запроса. Существующие метрики часто не справляются с разницей между закрытыми фактологическими вопросами и открытыми объяснительными запросами. Команда исследователей во главе с Чхве Чжонхваном (Jeonghwan Choi) из Южной Кореи представила Q-CARE (Query-Coverage and Claim Verifiability Evaluation) — полностью независимый от референсов (reference-free) фреймворк, принятый к публикации в конференции COLM 2026.
Как работает Q-CARE
Ключевая инновация метода — декомпозиция. Q-CARE разбивает исходный запрос пользователя на подзапросы (sub-queries), а сгенерированный ответ — на атомарные утверждения (atomic claims). Оценка строится на двух принципах:
- Query Coverage (Покрытие запроса): Насколько полно система ответила на все аспекты запроса.
- Claim Verifiability (Проверяемость утверждений): Можно ли каждое утверждение в ответе подтвердить извлеченными документами.
Новые метрики для ретриверов и генераторов
Фреймворк вводит специализированные метрики, адаптированные под эти принципы. Для оценки качества поиска (Retriever) предлагаются метрики, учитывающие покрытие запроса, а для генерации текста (Generator) — метрики полноты и проверяемости.
| Компонент | Метрика | Что измеряет |
|---|---|---|
| Retriever | C-Prec@k | Точность извлечения документов с учетом покрытия запроса |
| Retriever | C-nDCG@k | Нормализованная ранжирующая эффективность с учетом покрытия |
| Generator | Completeness | Полнота ответа относительно подзапросов |
| Generator | Conciseness | Лаконичность (отсутствие лишней воды) |
| Generator | Verifiableness | Доказуемость утверждений из контекста |
Результаты бенчмарков
Авторы протестировали Q-CARE на бенчмарке с человеческой аннотацией, охватывающем 8 различных датасетов. Результаты показали, что Q-CARE достигает более высокой корреляции с человеческими оценками (human judgments), чем четыре существующих метода оценки, включая популярные RAGEval и RAGChecker. Это доказывает, что подход, основанный на проверке утверждений, является более надежным инструментом для автоматизированной диагностики RAG-систем.
Код и данные для воспроизведения результатов уже опубликованы в открытом доступе, что позволяет разработчикам внедрить Q-CARE в свои пайплайны оценки уже сейчас.
Источник: arXiv cs.AI ↗
