Проблема «разрыва идентичности»
Команда исследователей во главе с Сиддхартом Вохрой (Siddharth Vohra) провела аудит гибридных пайплайнов Grounded Language Models (GroundLM). Они обнаружили, что стандартные бенчмарки часто маскируют реальную проблему: объект, выбранный системой, не всегда совпадает с тем, что фактически извлечено из базы знаний. Это явление авторы называют «разрывом передачи идентичности» (identity handoff failure).
Для проверки использовался датасет HybridQA с выборкой в 600 вопросов. Исследователи проанализировали 1,463 разрешимых записей, где выбранный объект теоретически должен был привести к нужному документу.
Цифры и метрики эффективности
Ключевой вывод исследования касается эффективности методов поиска. Простое извлечение по ключу (exact key lookup) и точное совпадение заголовков работают безупречно, но реальные системы используют ранжирование. Ниже приведены результаты сравнения методов поиска при отсечке (cutoff) в 5 документов:
| Метод поиска | Количество упущенных объектов | Процент ошибок |
|---|---|---|
| Body-only BM25 | 389 записей | 26.6% |
| Гибридный поиск с реранкингом | 14 записей | 1.0% |
Разница между «выбранным» и «возвращенным» объектом наблюдается в 329 из 1,792 разрешимых записей. Даже при использовании оригинальных запросов расхождения в топ-5 результатах возникают в 5.9% случаев.
Влияние на точность ответов
Самое важное открытие касается влияния этого разрыва на финальный ответ модели. Сравнения с «замороженным» читателем (frozen reader) показали, что наличие правильного объекта в контексте повышает точность совпадения (exact match) на 28.6–31.0 пунктов.
Дополнительный эксперимент на выборке из 64 элементов подтвердил причинно-следственную связь: удаление именно целевого документа резко снижает точность ответа, тогда как удаление документа схожей длины, но не относящегося к делу, такого эффекта не дает.
Новый стандарт аудита: ROP
Авторы публикуют Returned-Object Profile (ROP) — исполняемый протокол, который фиксирует целевой объект, поле возвращенного ID, порог отсечки и полное ожидаемое население. Этот инструмент позволяет воспроизводить ошибки offline и аудировать пайплайны с точностью, недоступной при стандартных метриках Recall.
Работа принята к публикации на воркшопе GroundLM (Grounding Language Models: Learning Faithfully and Efficiently) в рамках конференции EMNLP 2026.
Источник: arXiv cs.AI ↗
