Исследования7 сентября 2026 г., 18:18 МСК🤖 Auto

Потерянные объекты: почему RAG-системы теряют контекст

Исследование EMNLP 2026 выявило критический разрыв в RAG-пайплайнах: до 26.6% релевантных документов отбрасываются на этапе поиска, что снижает точность ответов LLM на 30 пунктов.

Баннер новости 6949

Проблема «разрыва идентичности»

Команда исследователей во главе с Сиддхартом Вохрой (Siddharth Vohra) провела аудит гибридных пайплайнов Grounded Language Models (GroundLM). Они обнаружили, что стандартные бенчмарки часто маскируют реальную проблему: объект, выбранный системой, не всегда совпадает с тем, что фактически извлечено из базы знаний. Это явление авторы называют «разрывом передачи идентичности» (identity handoff failure).

Для проверки использовался датасет HybridQA с выборкой в 600 вопросов. Исследователи проанализировали 1,463 разрешимых записей, где выбранный объект теоретически должен был привести к нужному документу.

Цифры и метрики эффективности

Ключевой вывод исследования касается эффективности методов поиска. Простое извлечение по ключу (exact key lookup) и точное совпадение заголовков работают безупречно, но реальные системы используют ранжирование. Ниже приведены результаты сравнения методов поиска при отсечке (cutoff) в 5 документов:

Метод поиска Количество упущенных объектов Процент ошибок
Body-only BM25 389 записей 26.6%
Гибридный поиск с реранкингом 14 записей 1.0%

Разница между «выбранным» и «возвращенным» объектом наблюдается в 329 из 1,792 разрешимых записей. Даже при использовании оригинальных запросов расхождения в топ-5 результатах возникают в 5.9% случаев.

Влияние на точность ответов

Самое важное открытие касается влияния этого разрыва на финальный ответ модели. Сравнения с «замороженным» читателем (frozen reader) показали, что наличие правильного объекта в контексте повышает точность совпадения (exact match) на 28.6–31.0 пунктов.

Дополнительный эксперимент на выборке из 64 элементов подтвердил причинно-следственную связь: удаление именно целевого документа резко снижает точность ответа, тогда как удаление документа схожей длины, но не относящегося к делу, такого эффекта не дает.

Новый стандарт аудита: ROP

Авторы публикуют Returned-Object Profile (ROP) — исполняемый протокол, который фиксирует целевой объект, поле возвращенного ID, порог отсечки и полное ожидаемое население. Этот инструмент позволяет воспроизводить ошибки offline и аудировать пайплайны с точностью, недоступной при стандартных метриках Recall.

Работа принята к публикации на воркшопе GroundLM (Grounding Language Models: Learning Faithfully and Efficiently) в рамках конференции EMNLP 2026.

Источник: arXiv cs.AI ↗