Исследования7 августа 2026 г., 22:17 МСК🤖 Auto

GraphRAG vs Vector RAG: тройная проверка на надежность

Исследование на 4440 запусках показало, что GraphRAG универсально перецифрует ссылки, а его надежность критически зависит от типа данных, а не архитектуры.

Баннер новости 5333

Масштабное тестирование RAG-архитектур

Исследователи Meftun Akarsu и Burak Ozdemir провели беспрецедентный анализ надежности систем Retrieval-Augmented Generation (RAG). В отличие от предыдущих работ, ограниченных одним корпусом, эта работа использует «тройную робастность», варьируя три независимые оси: архитектуру извлечения, тип корпуса данных и модель-судью. Всего было выполнено 4440 основных запусков, 600 кросс-корпусных тестов и 1200 парных оценок достоверности.

В исследовании сравнивались локальный эмбеддер e5-small и облачный Azure text-embedding-3-small, а также модели GPT-5.4 и GPT-4.1 в роли независимых судей.

Универсальная патология: перецифрование в GraphRAG

Ключевое открытие (C2a) заключается в том, что GraphRAG демонстрирует архитектурно универсальную проблему перецифрования (over-citation). Независимо от используемого корпуса или эмбеддера, GraphRAG генерирует от 11 до 15 идентификаторов ссылок на один ответ. При этом точность цитирования (citation precision) остается низкой — в диапазоне 0.12–0.23, хотя полнота извлечения (retrieval recall) достигает 0.68–0.87. Это означает, что система находит нужные фрагменты, но засоряет ответ множеством нерелевантных или слабосвязанных ссылок.

Зависимость достоверности от типа данных

Влияние перецифрования на достоверность ответов (faithfulness) оказывается условным (C2b) и зависит от структуры данных:

  • DO-178C (авиационные стандарты): Достоверность GraphRAG катастрофически падает с 74% до 40% при увеличении числа шагов (hops). Строгая логика связей не выдерживает шума из лишних ссылок.
  • Wikipedia (через MuSiQue): В этом корпусе та же архитектура показывает рост достоверности с 42% до 58%. Причина в том, что в естественном языке «перецифрованные» абзацы часто остаются тематически близкими к вопросу, маскируя неточность.

Победитель зависит от корпуса, но устойчив к эмбеддерам

Исследование (C1) опровергает идею абсолютного превосходства одной архитектуры. Лучшая модель зависит от данных:

  • На корпусе DO-178C лучше справляется с 2-шаговыми запросами классический Vector RAG.
  • На корпусе MuSiQue (Wikipedia) побеждает GraphRAG.

Важно отметить, что эти результаты идентичны как для локального e5-small, так и для Azure text-embedding-3-small, что делает выбор эмбеддера вторичным фактором по сравнению с выбором архитектуры под конкретную задачу.

Хрупкость LLM-судей и новый роутер

Отдельно исследована надежность самих моделей-судей. Оказалось, что оценка достоверности одним LLM крайне нестабильна: коэффициент каппы (self-kappa) для GPT-5.4 составил всего 0.137. Модель меняла свой вердикт в 41% случаев при изменении состояния извлечения, даже не меняя саму модель.

В качестве решения предложено обученное маршрутизирующее устройство (router) на основе плотных эмбеддингов, которое достигает макро-F1 0.86 в классификации шагов запроса, предлагая более надежный способ фильтрации результатов RAG.

Метрика / Параметр GraphRAG Vector RAG Примечание
Среднее кол-во ссылок 11–15 Не указано (ниже) GraphRAG систематически перецифровывает
Точность цитирования 0.12–0.23 Выше Критически низкий показатель GraphRAG
Достоверность (DO-178C, 2-hop) 40% (падение с 74%) Выше Крах надежности GraphRAG на строгих данных
Достоверность (Wikipedia, 2-hop) 58% (рост с 42%) Ниже GraphRAG выигрывает на естественном языке
Стабильность судьи GPT-5.4 Kappa 0.137 41% изменений вердикта при вариациях

Источник: arXiv cs.CL ↗