Проблема монолитных моделей
Традиционные нейросетевые подходы к Entity Disambiguation (ED) объединяют два этапа — поиск кандидатов и выбор правильного — в единое пространство эмбеддингов. Это создает конфликт оптимизации: модель вынуждена балансировать между высоким recall при поиске и точностью при выборе. Кроме того, такие системы требуют постоянного переобучения ретриверов при обновлении баз знаний, что дорого и сложно поддерживать.
Решение: модульный подход
Авторы (Fina Polat, Daniel Daza и др.) предлагают разделить процесс на два независимых модуля: спаршенный/плотный ретривер для генерации кандидатов и LLM-селектор для финального выбора. Ключевой вопрос исследования: насколько критично качество ретривера, если селектор уже достаточно силен?
Результаты на бенчмарке ZELDA
Команда провела систематическое сравнение стратегий поиска (BM25, Web KB, Dense Retriever) в связке с различными LLM. Результаты показали, что делегирование выбора LLM нивелирует необходимость в сложном обученном ретривере.
| Конфигурация | inKB micro-F1 | Примечание |
|---|---|---|
| BM25 + LLM (без обучения) | 86.3 | Новый SOTA для training-free подхода (+4 к базовому) |
| Dense Retriever + LLM | 88.5 | Прирост всего +2.2 пункта за счет обучения |
| BM25 + LLM (с abstention) | 90.7 | Максимальный F1 при возможности отказа от ответа |
Ключевое открытие: Abstention
Самый важный вывод статьи касается надежности. В стандартных системах, если правильный сущность не попала в выборку ретривера, модель все равно вынуждена выбрать что-то из предложенного, выдавая ошибку. Модульная архитектура позволяет системе воздержаться от ответа (abstain), если LLM не находит уверенного совпадения. В сценарии, где за правильный отказ начисляются баллы, связка BM25 + LLM достигает F1 90.7, что превосходит все монолитные аналоги.
Вывод для индустрии
Для многих задач ED оптимальная стратегия — «Select, Don't Train». Использование легковесного BM25 для поиска и мощной LLM для выбора дает сопоставимую с обученными dense-моделями точность, но с меньшими затратами на инфраструктуру и возможностью корректно обрабатывать edge-cases через механизм отказа от ответа.
Источник: arXiv cs.CL ↗
