Исследования30 июля 2026 г., 10:18 МСК🤖 Auto

Локальные LLM для перевода: сравнение с NLLB и OPUS-MT

Исследование arXiv 2026 года показало, что специализированные модели перевода (NLLB, OPUS-MT) всё ещё превосходят локальные LLM, но правильная настройка промптов и демонстраций позволяет Qwen2.5 и Mistral значительно улучшить результаты.

Баннер новости 4702

Суть исследования

Автор Михаэль Аркан (Mihael Arcan) провёл сравнительный анализ эффективности локальных больших языковых моделей (LLM) в задачах машинного перевода. В отличие от стандартных тестов, где модель переводит одно предложение, исследование фокусировалось на двух ключевых переменных: ширине промпта (запрос одного языка vs. JSON-формат для всей языковой семьи) и выборе демонстраций (few-shot примеры: случайные, лексически похожие или извлечённые по эмбеддингам).

Участники и метрики

Тестирование проводилось на полном сплите FLORES devtest для перевода с английского на романские и германские языки (9 официальных языков ЕС). В сравнении участвовали три локальные instruction-tuned модели и два специализированных базиса.

Категория Модели Особенности
Локальные LLM llama3.2:3b, mistral:latest, qwen2.5:14b Разные размеры и архитектуры, тестируемые на гибкость промптов
Специализированные MT OPUS-MT, NLLB-200 Базовые системы машинного перевода, не являющиеся LLM общего назначения

Ключевые результаты

  • Превосходство специализированных систем: NLLB-200 и OPUS-MT показали наилучшие общие результаты, особенно в германских языках. Это подтверждает, что для чистой задачи перевода узкоспециализированные модели пока надёжнее.
  • Влияние Few-shot: Использование 5 примеров (k=5) улучшило результаты для mistral:latest и qwen2.5:14b, но негативно сказалось на llama3.2:3b, что указывает на чувствительность малых моделей к шуму в контексте.
  • Стратегия выбора примеров: Извлечение примеров по эмбеддингам (embedding-similarity) показало лучшие средние результаты для сильных моделей, однако преимущество перед случайным выбором и лексическим сходством оказалось modest (умеренным).
  • Family-scope промптинг: Запрос перевода на все языки семьи одновременно в формате JSON выполним для мощных моделей (Qwen2.5, Mistral), но вызывает сбои в структурированном выводе у более слабых моделей (Llama 3.2 3B).

Вывод для разработчиков

Исследование мотивирует оценивать локальные LLM не только по метрикам BLEU/chrF, но и по способности соблюдать структуру вывода (JSON) при мультиязычных запросах. Для достижения конкурентоспособности с NLLB необходимо тщательно подбирать стратегию демонстраций (preferably embedding-based) и избегать перегрузки контекста в малых моделях.

Источник: arXiv cs.CL ↗