Проблема скрытых сбоев на границе языков
Традиционные многоязычные бенчмарки часто просто переводят весь пример на один язык, что скрывает реальные проблемы моделей при работе с разнородными источниками. Авторы нового исследования подчеркивают, что это маскирует сбои именно на границе языков внутри цепочки рассуждений. Для решения этой проблемы создана структура, где каждый вопрос, мостовое доказательство, ответ и отвлекающие факторы имеют явное назначение языка.
Масштаб и структура датасета
XHotpotQA представляет собой граф зависимостей доказательств, позволяющий детально анализировать процесс поиска информации. Датасет включает:
- 15 661 обучающий пример;
- 7 405 примеров для валидации;
- Предоставленные отвлекающие факторы (distractors) и надзор на уровне предложений.
Ключевые метрики кросс-лингвального взаимодействия
Анализ валидационной выборки показывает высокую степень лингвистического разнообразия: 99,81% вопросов требуют перехода от языка вопроса к языку золотого доказательства, а 95,60% используют золотые абзацы на разных языках. Это создает строгие условия для тестирования систем, интегрирующих знания.
Результаты тестирования моделей
Эксперименты с тремя моделями-читателями выявили существенный разрыв в производительности в зависимости от совпадения языков. Полное несоответствие языка вопроса и доказательств снижает Unicode-aware F1 на 10,25–15,79 пункта по сравнению с частичным выравниванием. Использование доказательств на разных алфавитах приводит к дефициту в 11,98–23,70 пункта. При этом модули выбора кандидатов показывают меньшую чувствительность к этим факторам (разница всего 1,71–1,78 пункта), что указывает на узкое место именно в этапе чтения и синтеза информации.
| Фактор сравнения | Полное несоответствие языков (F1) | Частичное выравнивание (F1) | Разница (Δ F1) |
|---|---|---|---|
| Обычные языки | Ниже на 10,25–15,79 | База | 10,25–15,79 |
| Разные алфавиты | Ниже на 11,98–23,70 | База | 11,98–23,70 |
Значение для индустрии
XHotpotQA предоставляет ролевую диагностику и модульную оценку, становясь важным инструментом для разработки систем, которым необходимо интегрировать разрозненные знания из многоязычной среды. Это позволяет инженерам точно выявлять, на каком этапе рассуждения модель теряет контекст при смене языка.
Источник: arXiv cs.CL ↗
