Исследования1 июля 2026 г., 21:17 МСК🤖 Auto

Qwen2.5-7B побил zero-shot в арабско-русском переводе: новый бенчмарк

Исследователь M. K. Arabov представил первый крупный параллельный корпус для научного перевода с арабского на русский и показал, что дообучение Qwen2.5-7B через QLoRA дает прирост BLEU +4.36 по сравнению с базовыми моделями.

Баннер новости 2760

Преодоление языкового барьера в науке

Русский и арабский языки являются ключевыми для научной коммуникации, однако отсутствие качественных инструментов перевода тормозит международное сотрудничество. В статье, опубликованной 29 июня 2026 года в arXiv (cs.CL), представлен новый бенчмарк и датасет, направленные на устойчивый обмен знаниями (SDG 17 и SDG 9 ООН). Работа решает проблему фрагментации научных данных между русскоязычным и арабоязычным сообществами.

Детали датасета: 27 000 пар предложений

Авторы создали гибридный параллельный корпус объемом около 27 000 пар предложений. В него вошли не только научные аннотации, но и тексты общего назначения (религия, новости, разговоры), что позволяет моделям лучше понимать контекст. Этот набор данных становится эталоном для оценки качества машинного перевода в узкой предметной области.

Эксперименты с моделями: от mT5 до Qwen2.5

Для тестирования были выбраны три многоязычные модели: mT5-base (580 млн параметров), NLLB-200-distilled-1.3B (1.3 млрд) и Qwen2.5-7B-Instruct (7 млрд). Все модели дообучались с помощью техники LoRA с рангами 8, 16, 32 и 64. Ключевым выводом стало то, что few-shot prompting (с тремя примерами) не улучшил результаты, что доказывает необходимость именно дообучения (fine-tuning) на предметных данных.

Результаты: Qwen2.5-7B с QLoRA лидирует

Лучшие показатели показал Qwen2.5-7B с оптимизацией QLoRA (rank 8). Модель превзошла zero-shot базовый уровень по всем метрикам, что критически важно для сохранения научной точности. Ниже приведена сводка метрик для лучшей конфигурации:

Метрика Значение Примечание
BLEU 23.15 +4.36 выше zero-shot
chrF 43.89
BERTScore 0.906 Высокое семантическое сходство
COMET 0.758 +0.051 выше zero-shot

Открытый доступ и значимость

Авторы опубликовали код для оценки, сам корпус и дообученные модели. Это позволяет исследователям сразу интегрировать инструменты в свои пайплайны. Снижение языкового барьера способствует инновационной инфраструктуре и ускорению исследований в области устойчивого развития, делая научные достижения доступными для более широкой аудитории.

Источник: arXiv cs.CL ↗