Проблема: «Разные языки — разные ответы»
Многоязычные языковые модели (LLM) часто демонстрируют кросс-лингвистическую несогласованность (CLC): на семантически эквивалентные вопросы на разных языках модель дает разные ответы. Это критично для глобальных приложений, где важна предсказуемость. Авторы работы A Systematic Evaluation of Cross-Lingual Consistency Enhancement Methods (arXiv:2609.04409) решили устранить разрозненность оценок, проведя унифицированное сравнение методов улучшения CLC.
Методология: Единый полигон для разных подходов
Исследование охватывает три семейства моделей и три закрытых бенчмарка (closed-form benchmarks). Сравнение велось между двумя основными категориями методов:
- Inference-time interventions: вмешательства во время генерации (например, логит-бустинг, guidance).
- Post-training approaches: дообучение моделей (SFT, RLHF) на специально подобранных данных.
Ключевые результаты: Пост-тренинг побеждает
Результаты показали, что методы пост-тренировочной коррекции (post-training) являются более надежными. Особую эффективность продемонстрировал метод direct distribution alignment (прямое выравнивание распределений), который стабильно улучшал согласованность во всех связках «модель-датасет».
Другие методы оказались чувствительными к формату ответа и широте покрытия языков. Важный вывод: кросс-доменное переносимости (transfer) ограничено, если задачи источника и цели имеют разные форматы вывода.
| Категория метода | Надежность (CLC) | Чувствительность к формату | Примечание |
|---|---|---|---|
| Post-training (Direct Alignment) | Высокая | Низкая | Стабильное улучшение на всех наборах данных |
| Inference-time Interventions | Средняя/Низкая | Высокая | Зависит от формата ответа и охвата языков |
| Cross-domain Transfer | Низкая | Критическая | Работает только при совпадении форматов вывода |
Риск: Утрата культурной специфики
Главный вопрос: не «выравнивает» ли модель ответы до такой степени, что она теряет способность учитывать культурные различия? Авторы проверили это на двух бенчмарках с культурно-зависимыми вопросами.
- Closed-form evaluation: систематического ухудшения качества не обнаружено. Модель сохраняет способность давать разные ответы, когда это необходимо.
- Open-ended generation: выявлены случаи снижения точности, особенно для ответов на языках, отличных от английского (non-English responses).
Вывод для индустрии
Работа подчеркивает необходимость оценивать методы улучшения согласованности не только через призму кросс-доменной робастности, но и через призму культурно-адекватной вариативности. Для разработчиков это означает, что слепое применение методов выравнивания распределений может привести к «обесцвечиванию» ответов на не-англоязычных языках при свободной генерации текста.
Источник: arXiv cs.CL ↗
