Исследования21 июля 2026 г., 12:18 МСК🤖 Auto

Shapley Context Pruning: Игроки, а не шум. Новый подход к RAG

Исследователи представили SCP — фреймворк, использующий теорию кооперативных игр для оценки вклада предложений в ответ LLM, заменяя эвристики математически строгим отбором контекста.

Баннер новости 4027

Проблема RAG: от эвристики к теории игр

В современных системах Retrieval-Augmented Generation (RAG) критическим узким местом является не поиск, а ранжирование и отсечение (pruning) извлеченных фрагментов. Традиционные методы опираются на эвристические функции потерь или эмпирическую атрибуцию, что часто приводит к потере важных деталей. Авторы работы Shapley Context Pruning (SCP) предлагают радикально иной подход: они моделируют контекст как кооперативную игру, где каждое предложение — это игрок, стремящийся максимизировать «выплату» (качество ответа модели).

Техническая суть: Deep Sets и Шепли

Ключевая инновация SCP заключается в использовании архитектуры Deep Sets для аппроксимации функции значения, инвариантной к перестановкам. Это позволяет оценивать вклад каждого предложения в контексте независимо от его порядка. Для обучения применяется pairwise margin ranking loss, а для обеспечения масштабируемости без потери математической строгости используется Монте-Карло сэмплирование. Метод предоставляет формальные теоретические границы ошибок и гарантии сложности выборки для сохранения топ-K подмножеств.

Результаты и бенчмарки

Эксперименты SCP охватывают широкий спектр задач, от поиска «иголки в стоге сена» (Needle-in-the-Haystack) до многошагового рассуждения. Модель демонстрирует конкурентоспособные результаты по сравнению с сильными базовыми линиями, эффективно балансируя между детализацией и обобщением представлений.

Метрика / Задача Описание оценки Результат SCP
Supporting-sentence recall Точность нахождения опорных предложений Конкурентоспособно с SOTA
Needle-in-the-Haystack (NIAH) Поиск фактов в длинном контексте Высокая эффективность
Long-context QA Вопросно-ответные системы на длинных текстах Стабильные метрики
Multi-hop reasoning Многошаговое логическое рассуждение Превосходство над эвристиками

Почему это важно

SCP закрывает пробел в интерпретируемости RAG-систем. Вместо черного ящика, где мы не знаем, почему модель выбрала именно эти абзацы, мы получаем кооперативную перспективу. Это позволяет инженерам точно настраивать длину контекста, экономя токены и вычислительные ресурсы, сохраняя при этом качество ответов. Работа опубликована 10 мая 2026 года в arXiv (cs.AI).

Источник: arXiv cs.AI ↗