Проблема универсальных политик в GraphRAG
Большинство современных систем Graph Retrieval-Augmented Generation (GraphRAG) используют единый, фиксированный алгоритм обхода графа для всех запросов. Авторы работы отмечают структурное несоответствие: прямые факты требуют компактных локальных окрестностей, сравнительные вопросы — сбалансированного охвата нескольких целей, а опосредованные запросы нуждаются в глубоких путях через слабо связанные узлы. MOSAIC решает эту проблему, формулируя извлечение знаний как задачу управления, зависящую от конкретного запроса (per-query).
Как работает MOSAIC
Ключевое преимущество подхода — отсутствие необходимости дообучения (training-free). Система использует LLM-анализатор, который преобразует специфические требования запроса к доказательствам в ограниченную политику (bounded policy). Эта политика управляет четырьмя этапами:
- Выбор стартовых узлов (seed selection).
- Обход графа (graph traversal).
- Условие остановки (stopping).
- Отбор доказательств (evidence selection).
При этом сам граф корпуса, индексы, функции скоринга и генератор ответов остаются неизменными и общими для всех запросов.
Результаты на GraphRAG-Bench
Эксперименты проводились на датасетах Medical и Novel. MOSAIC превзошел самые сильные ранее опубликованные результаты, улучшив общую точность ответов (Answer Correctness) на 5.13 и 4.43 балла соответственно. Ниже приведено сравнение ключевых метрик:
| Метрика | Модель MOSAIC | Лучшая фиксированная политика | Прирост / Особенность |
|---|---|---|---|
| Answer Correctness (Medical) | 76.97 | 71.84 | +5.13 балла |
| Answer Correctness (Novel) | 64.33 | 59.90 | +4.43 балла |
| Evidence Recall (Medical) | 95.1 | — | Высокая полнота |
| Context Relevancy (Medical) | 86.1 | — | Релевантность контекста |
| Улучшение над лучшей фикс. политикой | — | — | +9.96 балла |
Эффективность и переносимость
Адаптивность MOSAIC достигается за счет оптимизации ресурсов. По сравнению с фиксированной широкой политикой (Fixed Wide), MOSAIC оценивает на 81.9% меньше путей и сохраняет на 47.2% меньше элементов доказательств, что снижает вычислительную нагрузку при повышении качества. Кроме того, тесты на перенос (transfer experiments) на датасетах HotpotQA, MuSiQue и 2WikiMultiHopQA показали, что интерфейс политики можно применять без специфичного для бенчмарка обучения ретривера.
Источник: arXiv cs.AI ↗
