Проблема RAG: от эвристики к теории игр
В современных системах Retrieval-Augmented Generation (RAG) критическим узким местом является не поиск, а ранжирование и отсечение (pruning) извлеченных фрагментов. Традиционные методы опираются на эвристические функции потерь или эмпирическую атрибуцию, что часто приводит к потере важных деталей. Авторы работы Shapley Context Pruning (SCP) предлагают радикально иной подход: они моделируют контекст как кооперативную игру, где каждое предложение — это игрок, стремящийся максимизировать «выплату» (качество ответа модели).
Техническая суть: Deep Sets и Шепли
Ключевая инновация SCP заключается в использовании архитектуры Deep Sets для аппроксимации функции значения, инвариантной к перестановкам. Это позволяет оценивать вклад каждого предложения в контексте независимо от его порядка. Для обучения применяется pairwise margin ranking loss, а для обеспечения масштабируемости без потери математической строгости используется Монте-Карло сэмплирование. Метод предоставляет формальные теоретические границы ошибок и гарантии сложности выборки для сохранения топ-K подмножеств.
Результаты и бенчмарки
Эксперименты SCP охватывают широкий спектр задач, от поиска «иголки в стоге сена» (Needle-in-the-Haystack) до многошагового рассуждения. Модель демонстрирует конкурентоспособные результаты по сравнению с сильными базовыми линиями, эффективно балансируя между детализацией и обобщением представлений.
| Метрика / Задача | Описание оценки | Результат SCP |
|---|---|---|
| Supporting-sentence recall | Точность нахождения опорных предложений | Конкурентоспособно с SOTA |
| Needle-in-the-Haystack (NIAH) | Поиск фактов в длинном контексте | Высокая эффективность |
| Long-context QA | Вопросно-ответные системы на длинных текстах | Стабильные метрики |
| Multi-hop reasoning | Многошаговое логическое рассуждение | Превосходство над эвристиками |
Почему это важно
SCP закрывает пробел в интерпретируемости RAG-систем. Вместо черного ящика, где мы не знаем, почему модель выбрала именно эти абзацы, мы получаем кооперативную перспективу. Это позволяет инженерам точно настраивать длину контекста, экономя токены и вычислительные ресурсы, сохраняя при этом качество ответов. Работа опубликована 10 мая 2026 года в arXiv (cs.AI).
Источник: arXiv cs.AI ↗
