Исследования12 августа 2026 г., 06:18 МСК🤖 Auto

NLLB-200 для Limbum: как инициализация эмбеддингов спасает low-resource языки

Исследователи представили метод инициализации языковых токенов для NLLB-200, позволяющий переводить незарегистрированные языки (на примере Limbum) с качеством, близким к подбору единственного прокси-языка.

Баннер новости 5580

Проблема «невидимых» языков в NLLB-200

Модель NLLB-200 от Meta покрывает 200 языков, но тысячи других, включая большинство языков группы Grassfields Bantu (Камерун), остаются за бортом. При попытке дообучить (fine-tune) модель для такого «неуказанного» языка разработчикам приходится выбирать язык-прокси (proxy language token) — то есть язык из списка поддерживаемых, который будет служить отправной точкой. До сих пор не существовало строгого метода выбора такого прокси, что приводило к хаотичным результатам.

Решение: усреднение эмбеддингов

Авторы работы (Samiratu Ntohsi и соавт.) предложили стратегию, при которой токен нового языка инициализируется не как копия одного существующего языка, а как среднее арифметическое эмбеддингов нескольких типологически родственных языков, уже присутствующих в модели. Это позволяет создать более сбалансированное представление для нового языка, учитывая его множественные лингвистические связи.

Эксперимент на Limbum-English

Для проверки метода команда использовала параллельный корпус из 8 837 предложений (текст Нового Завета) и двуязычный словарь для перевода с языка Limbum на английский. Были протестированы четыре конфигурации, результаты которых приведены ниже:

Модель / Конфигурация Метрика (chrF2++) Примечание
NLLB-200 (Zero-shot) 12.5 Базовый уровень без дообучения
Transformer (с нуля) 14.5 Обучение с нуля на малых данных
NLLB-200 + Swahili Proxy 47.3 Лучший результат среди одиночных прокси
NLLB-200 + Avg. Embedding Init 46.7 Предложенный метод (многоязычная инициализация)

Ключевые выводы

  • Эффективность: Многоязычная инициализация (46.7 chrF2++) практически не уступает лучшему одиночному прокси (Swahili, 47.3 chrF2++). Разница в 0.6 балла статистически незначима для практического применения.
  • Преимущество трансфера: Любая дообученная версия NLLB-200 превосходит обучение с нуля более чем на 32 пункта chrF2++. Это доказывает, что для крайне малообеспеченных языков (low-resource) доминирующим фактором успеха является именно многоязычный трансфер знаний, а не выбор конкретного «родственного» языка.
  • Устранение эвристики: Метод усреднения убирает необходимость в сложном ручном подборе прокси-языка, упрощая процесс адаптации NLLB для новых языков.

Открытая проблема: Тон

Несмотря на успех в синтаксисе и лексике, все протестированные системы (включая NLLB) не смогли сохранить тоновые диакритические знаки Limbum. Это указывает на то, что текущие архитектуры NMT все еще испытывают трудности с передачей тональной информации, что остается открытым вызовом для исследователей. Авторы опубликовали датасет и код для воспроизведения результатов.

Источник: arXiv cs.CL ↗