Проблема гендерной предвзятости в машинном переводе
Системы машинного перевода (MT) продолжают генерировать переводы с гендерными искажениями. В эпоху, когда самовыражение критически важно, ошибки, основанные на стереотипах или поведении по умолчанию, могут причинить реальный вред пользователям. Ключевая проблема заключается в том, что модели часто «догадываются» о поле говорящего или объекта, даже когда в исходном тексте нет четких указаний.
Что такое GAND?
Команда исследователей во главе с Джаницей Хакенбунер (Janiça Hackenbuchner) представила GAND (Gender-Ambiguous Natural Data) — специализированный ресурс для бенчмаркинга. Датасет состоит из английских исходных предложений, специально спроектированных для анализа влияния контекстуальных подсказок на перевод пола. Цель — создать естественные сценарии, где пол неочевиден, чтобы проверить, на какие именно слова опирается модель.
Методология: Контрастная атрибуция
Для интерпретируемости авторы не просто перевели датасет, а провели сложный анализ:
- Подмножество GAND было переведено на два языка с грамматическим родом.
- К переводу были добавлены вручную созданные контрастные варианты (contrastive translations).
- Применен метод атрибуции признаков (feature attribution) для выявления конкретных слов в контексте, которые повлияли на выбор рода в целевом переводе.
Значение для индустрии
Работа принята к публикации в EAMT2026 (Technical Track). GAND позволяет разработчикам MT не просто констатировать наличие bias, а понимать механику его возникновения: какие именно контекстуальные маркеры «сбивают с толку» модель. Это шаг к созданию более этичных и точных переводчиков, учитывающих нюансы самовыражения пользователей.
Источник: arXiv cs.CL ↗
