Исследования13 августа 2026 г., 14:18 МСК🤖 Auto

Q-CARE: Революция в оценке RAG без референсов

Исследователи представили Q-CARE — фреймворк для оценки RAG-систем, не требующий эталонных ответов. Метрика превосходит RAGEval и RAGChecker по корреляции с человеческими оценками.

Баннер новости 5703

Проблема оценки систем Retrieval-Augmented Generation (RAG) заключается в их зависимости от контекста запроса. Существующие метрики часто не справляются с разницей между закрытыми фактологическими вопросами и открытыми объяснительными запросами. Команда исследователей во главе с Чхве Чжонхваном (Jeonghwan Choi) из Южной Кореи представила Q-CARE (Query-Coverage and Claim Verifiability Evaluation) — полностью независимый от референсов (reference-free) фреймворк, принятый к публикации в конференции COLM 2026.

Как работает Q-CARE

Ключевая инновация метода — декомпозиция. Q-CARE разбивает исходный запрос пользователя на подзапросы (sub-queries), а сгенерированный ответ — на атомарные утверждения (atomic claims). Оценка строится на двух принципах:

  • Query Coverage (Покрытие запроса): Насколько полно система ответила на все аспекты запроса.
  • Claim Verifiability (Проверяемость утверждений): Можно ли каждое утверждение в ответе подтвердить извлеченными документами.

Новые метрики для ретриверов и генераторов

Фреймворк вводит специализированные метрики, адаптированные под эти принципы. Для оценки качества поиска (Retriever) предлагаются метрики, учитывающие покрытие запроса, а для генерации текста (Generator) — метрики полноты и проверяемости.

Компонент Метрика Что измеряет
Retriever C-Prec@k Точность извлечения документов с учетом покрытия запроса
Retriever C-nDCG@k Нормализованная ранжирующая эффективность с учетом покрытия
Generator Completeness Полнота ответа относительно подзапросов
Generator Conciseness Лаконичность (отсутствие лишней воды)
Generator Verifiableness Доказуемость утверждений из контекста

Результаты бенчмарков

Авторы протестировали Q-CARE на бенчмарке с человеческой аннотацией, охватывающем 8 различных датасетов. Результаты показали, что Q-CARE достигает более высокой корреляции с человеческими оценками (human judgments), чем четыре существующих метода оценки, включая популярные RAGEval и RAGChecker. Это доказывает, что подход, основанный на проверке утверждений, является более надежным инструментом для автоматизированной диагностики RAG-систем.

Код и данные для воспроизведения результатов уже опубликованы в открытом доступе, что позволяет разработчикам внедрить Q-CARE в свои пайплайны оценки уже сейчас.

Источник: arXiv cs.AI ↗