Проблема «редких» сущностей
Традиционные системы мультиязычного связывания сущностей (Entity Linking) часто терпят неудачу на объектах, которые не являются популярными. Авторы работы Think Before You Link (Parinthapat Pengpun, Simran Khanuja, Graham Neubig) показывают, что метрики популярности (например, количество просмотров страниц) не отражают реальную сложность задачи. Они ввели структурные метрики графа знаний, которые выявляют сущности с плохой документацией и слабой связностью. На таких «редких» срезах данных точность современных моделей падает на 15.4–39.9%.
Решение: Reasoning + Retrieval
Команда предложила фреймворк, не требующий дообучения (training-free), который использует мощные зрительно-языковые модели (VLM). Система работает итеративно: она не просто ищет ответ, а рассуждает и ищет доказательства в Wikipedia динамически. Эксперименты доказали, что эти два компонента дополняют друг друга:
- Только рассуждения не дают значимого прироста точности.
- Только поиск улучшает редкие сущности, но может снизить общую точность.
- Их комбинация дает наилучший результат.
Результаты на бенчмарке MERLIN
Оценка проводилась на мультиязычном мультиформатном бенчмарке MERLIN, охватывающем пять языков: хинди, индонезийский, японский, тамильский и вьетнамский. Предложенный подход показал существенное улучшение по сравнению с состоянием искусства (SOTA), особенно на сложных случаях.
| Метрика | Улучшение над SOTA |
|---|---|
| Общая точность (Overall) | +6.9% |
| Точность на редких сущностях (Rare-entity slices) | до +23.3% |
Значение для индустрии
Авторы опубликовали набор данных MERLIN-Rare, содержащий тестовые срезы для редких сущностей, что позволяет сообществу точнее оценивать устойчивость систем к «длинному хвосту» знаний. Работа принята в основную конференцию EMNLP 2026, что подтверждает важность перехода от простого поиска к цепочкам рассуждений (Chain-of-Thought) в задачах работы с графами знаний.
Источник: arXiv cs.CL ↗
