Автоматически созданные графы знаний (Knowledge Graphs, KG) часто содержат ошибки из-за шума в исходных данных. Проблема верификации таких фактов в промышленных масштабах остается критической. Команда исследователей во главе с Юмином Хё (Yumin Heo) представила AgentKGV — агентную LLM-RAG архитектуру, которая решает проблему неточного поиска за счет динамической маршрутизации и итеративного переписывания запросов.
Двухэтапное обучение: от дистилляции к оптимизации
Ключевое нововведение AgentKGV — стратегия двухэтапного обучения, направленная на повышение точности и снижение затрат. На первом этапе применяется turn-level distillation-based SFT: способность к рассуждению переносится от большой модели-учителя к компактной модели для стабильного переписывания запросов. На втором этапе используется trajectory-level GRPO (Group Relative Policy Optimization), который оптимизирует политику поиска, устраняя лишние вызовы ретривера.
Результаты на бенчмарке T-REx
Эксперименты проводились на длиннохвостом подмножестве предикатов открытого домена T-REx. Внедрение двухэтапного обучения дало значительный прирост метрики macro-F1 по сравнению с базовым RAG в один проход. Кроме того, алгоритм GRPO позволил сократить количество поисковых вызовов почти в два раза без потери качества.
| Метрика / Параметр | Single-turn RAG | AgentKGV (Two-Stage) | Эффект |
|---|---|---|---|
| Macro-F1 (прирост) | База | +5.5% (динам. роутинг) +9.4% (2 этапа) |
Значительный рост точности |
| Среднее число поисковых вызовов | 3.24 | 1.63 | Снижение затрат на 49.7% |
Почему это важно
AgentKGV демонстрирует, что агентные подходы в сочетании с оптимизацией политик (GRPO) могут не только повышать надежность верификации фактов, но и делать процесс экономически выгодным для внедрения в индустрии. Снижение количества запросов к внешним источникам напрямую влияет на стоимость эксплуатации LLM-систем.
Источник: arXiv cs.CL ↗
