Суть исследования
Автор Михаэль Аркан (Mihael Arcan) провёл сравнительный анализ эффективности локальных больших языковых моделей (LLM) в задачах машинного перевода. В отличие от стандартных тестов, где модель переводит одно предложение, исследование фокусировалось на двух ключевых переменных: ширине промпта (запрос одного языка vs. JSON-формат для всей языковой семьи) и выборе демонстраций (few-shot примеры: случайные, лексически похожие или извлечённые по эмбеддингам).
Участники и метрики
Тестирование проводилось на полном сплите FLORES devtest для перевода с английского на романские и германские языки (9 официальных языков ЕС). В сравнении участвовали три локальные instruction-tuned модели и два специализированных базиса.
| Категория | Модели | Особенности |
|---|---|---|
| Локальные LLM | llama3.2:3b, mistral:latest, qwen2.5:14b | Разные размеры и архитектуры, тестируемые на гибкость промптов |
| Специализированные MT | OPUS-MT, NLLB-200 | Базовые системы машинного перевода, не являющиеся LLM общего назначения |
Ключевые результаты
- Превосходство специализированных систем: NLLB-200 и OPUS-MT показали наилучшие общие результаты, особенно в германских языках. Это подтверждает, что для чистой задачи перевода узкоспециализированные модели пока надёжнее.
- Влияние Few-shot: Использование 5 примеров (k=5) улучшило результаты для mistral:latest и qwen2.5:14b, но негативно сказалось на llama3.2:3b, что указывает на чувствительность малых моделей к шуму в контексте.
- Стратегия выбора примеров: Извлечение примеров по эмбеддингам (embedding-similarity) показало лучшие средние результаты для сильных моделей, однако преимущество перед случайным выбором и лексическим сходством оказалось modest (умеренным).
- Family-scope промптинг: Запрос перевода на все языки семьи одновременно в формате JSON выполним для мощных моделей (Qwen2.5, Mistral), но вызывает сбои в структурированном выводе у более слабых моделей (Llama 3.2 3B).
Вывод для разработчиков
Исследование мотивирует оценивать локальные LLM не только по метрикам BLEU/chrF, но и по способности соблюдать структуру вывода (JSON) при мультиязычных запросах. Для достижения конкурентоспособности с NLLB необходимо тщательно подбирать стратегию демонстраций (preferably embedding-based) и избегать перегрузки контекста в малых моделях.
Источник: arXiv cs.CL ↗
