Проблема «невидимых» языков в NLLB-200
Модель NLLB-200 от Meta покрывает 200 языков, но тысячи других, включая большинство языков группы Grassfields Bantu (Камерун), остаются за бортом. При попытке дообучить (fine-tune) модель для такого «неуказанного» языка разработчикам приходится выбирать язык-прокси (proxy language token) — то есть язык из списка поддерживаемых, который будет служить отправной точкой. До сих пор не существовало строгого метода выбора такого прокси, что приводило к хаотичным результатам.
Решение: усреднение эмбеддингов
Авторы работы (Samiratu Ntohsi и соавт.) предложили стратегию, при которой токен нового языка инициализируется не как копия одного существующего языка, а как среднее арифметическое эмбеддингов нескольких типологически родственных языков, уже присутствующих в модели. Это позволяет создать более сбалансированное представление для нового языка, учитывая его множественные лингвистические связи.
Эксперимент на Limbum-English
Для проверки метода команда использовала параллельный корпус из 8 837 предложений (текст Нового Завета) и двуязычный словарь для перевода с языка Limbum на английский. Были протестированы четыре конфигурации, результаты которых приведены ниже:
| Модель / Конфигурация | Метрика (chrF2++) | Примечание |
|---|---|---|
| NLLB-200 (Zero-shot) | 12.5 | Базовый уровень без дообучения |
| Transformer (с нуля) | 14.5 | Обучение с нуля на малых данных |
| NLLB-200 + Swahili Proxy | 47.3 | Лучший результат среди одиночных прокси |
| NLLB-200 + Avg. Embedding Init | 46.7 | Предложенный метод (многоязычная инициализация) |
Ключевые выводы
- Эффективность: Многоязычная инициализация (46.7 chrF2++) практически не уступает лучшему одиночному прокси (Swahili, 47.3 chrF2++). Разница в 0.6 балла статистически незначима для практического применения.
- Преимущество трансфера: Любая дообученная версия NLLB-200 превосходит обучение с нуля более чем на 32 пункта chrF2++. Это доказывает, что для крайне малообеспеченных языков (low-resource) доминирующим фактором успеха является именно многоязычный трансфер знаний, а не выбор конкретного «родственного» языка.
- Устранение эвристики: Метод усреднения убирает необходимость в сложном ручном подборе прокси-языка, упрощая процесс адаптации NLLB для новых языков.
Открытая проблема: Тон
Несмотря на успех в синтаксисе и лексике, все протестированные системы (включая NLLB) не смогли сохранить тоновые диакритические знаки Limbum. Это указывает на то, что текущие архитектуры NMT все еще испытывают трудности с передачей тональной информации, что остается открытым вызовом для исследователей. Авторы опубликовали датасет и код для воспроизведения результатов.
Источник: arXiv cs.CL ↗
