Исследования31 августа 2026 г., 09:18 МСК🤖 Auto

XHotpotQA: Новый бенчмарк для кросс-лингвального QA

Исследователи представили XHotpotQA — первый контролируемый датасет для оценки способности моделей комбинировать знания из разных языков в задачах многошагового ответа.

Баннер новости 6396

Проблема скрытых сбоев на границе языков

Традиционные многоязычные бенчмарки часто просто переводят весь пример на один язык, что скрывает реальные проблемы моделей при работе с разнородными источниками. Авторы нового исследования подчеркивают, что это маскирует сбои именно на границе языков внутри цепочки рассуждений. Для решения этой проблемы создана структура, где каждый вопрос, мостовое доказательство, ответ и отвлекающие факторы имеют явное назначение языка.

Масштаб и структура датасета

XHotpotQA представляет собой граф зависимостей доказательств, позволяющий детально анализировать процесс поиска информации. Датасет включает:

  • 15 661 обучающий пример;
  • 7 405 примеров для валидации;
  • Предоставленные отвлекающие факторы (distractors) и надзор на уровне предложений.

Ключевые метрики кросс-лингвального взаимодействия

Анализ валидационной выборки показывает высокую степень лингвистического разнообразия: 99,81% вопросов требуют перехода от языка вопроса к языку золотого доказательства, а 95,60% используют золотые абзацы на разных языках. Это создает строгие условия для тестирования систем, интегрирующих знания.

Результаты тестирования моделей

Эксперименты с тремя моделями-читателями выявили существенный разрыв в производительности в зависимости от совпадения языков. Полное несоответствие языка вопроса и доказательств снижает Unicode-aware F1 на 10,25–15,79 пункта по сравнению с частичным выравниванием. Использование доказательств на разных алфавитах приводит к дефициту в 11,98–23,70 пункта. При этом модули выбора кандидатов показывают меньшую чувствительность к этим факторам (разница всего 1,71–1,78 пункта), что указывает на узкое место именно в этапе чтения и синтеза информации.

Фактор сравнения Полное несоответствие языков (F1) Частичное выравнивание (F1) Разница (Δ F1)
Обычные языки Ниже на 10,25–15,79 База 10,25–15,79
Разные алфавиты Ниже на 11,98–23,70 База 11,98–23,70

Значение для индустрии

XHotpotQA предоставляет ролевую диагностику и модульную оценку, становясь важным инструментом для разработки систем, которым необходимо интегрировать разрозненные знания из многоязычной среды. Это позволяет инженерам точно выявлять, на каком этапе рассуждения модель теряет контекст при смене языка.

Источник: arXiv cs.CL ↗