Архитектура и обучение: от базовой модели к экспертам
Index-Translate построена на базе базовых моделей Qwen 3.5 (версии 2B, 9B и 35B). Процесс обучения разделен на три ключевых этапа, что позволило объединить точность перевода с пониманием контекста:
- Mid-train: Использование планировщика WSD и смешивание корпусов (предтренировочных, многоязычных, параллельных и пивотных). Это заложило фундамент для кросс-лингвистического соответствия.
- Post-train: Обучение трех отдельных экспертных моделей: общей, для следования инструкциям и для перевода мемов. Применялись SFT и RL (Rubric as Reward / RLVR).
- Model-merge: Консолидация возможностей через линейную интерполяцию, MOPD и Mix-RL в единую модель.
Результаты бенчмарков: лидерство в нишах
Модель Index-Translate-35B (preview) демонстрирует выдающиеся результаты, особенно в задачах, требующих понимания инструкций (Instruction Following) и работы с культурным контекстом (мемы). Ниже приведено сравнение ключевых метрик на датасетах FLORES-200, WMT24++, instTrans и других.
| Модель | FLORES-200 (COMET-22) | WMT24++ (COMET-22) | instTrans (IFscore) | Meme (MEME) | Low-resource (COMET-22) |
|---|---|---|---|---|---|
| Index-Translate-35B (preview) | 0.8794 | 76.76 | 0.8336 | 0.7405 | 0.8168 |
| Index-Translate-9B | 0.8789 | 75.35 | 0.8209 | 0.7387 | 0.7992 |
| Index-Translate-2B | 0.8655 | 60.26 | 0.7569 | 0.6443 | 0.7377 |
| Hy-MT2-30B-A3B | 0.8787 | 66.81 | 0.6415 | 0.5812 | 0.6746 |
| GPT-5.6-sol | 0.8650 | 89.10 | 0.7624 | 0.7194 | 0.7669 |
| TranslateGemma-12B-it | 0.8732 | 71.19 | 0.3068 | 0.4281 | 0.8021 |
Примечание: В таблице показаны основные метрики. Для WMT26 оценка проводилась через GPT-5.6-Sol Judge. Индекс IFscore отражает способность модели следовать инструкциям (тон, обращение, формат).
Специализация: Мемы, инструкции и низкоресурсные языки
Главное отличие Index-Translate — не просто перевод слов, а передача смысла и тона. Модель умеет:
- Соблюдать инструкции: Пользователь может задать тон (разговорный, формальный), сохранить формы обращения или требовать только вывод перевода без комментариев.
- Понимать мемы: Модель обучена распознавать иронию, сарказм и культурные отсылки, что критично для интернет-контента.
- Работать с low-resource языками: На датасете FLORES_minor_pair (104 000 входов, 1 040 направлений, 62 языка) модель 35B показала лучший результат по COMET-22 (0.8168) и XCOMET-XXL (0.7164) при минимальном проценте ошибок «off-target» (2.4%).
Дополнительно: Index-Echo для перевода речи
Параллельно с текстовыми моделями Bilibili представила Index-Echo — модель end-to-end перевода речи в речь (S2ST). Она поддерживает 6 языков (включая китайский и английский), сохраняет тембр говорящего (zero-shot timbre preservation) и генерирует синхронизированные субтитры. Архитектура использует энкодер Qwen3-Omni AuT и напрямую выравнивает скрытые представления LLM с семантическим слоем CosyVoice3, минуя каскад ASR+MT+TTS.
Где попробовать?
Модели доступны на Hugging Face и ModelScope в версиях 2B, 9B и 35B (preview). Для текстового перевода доступна онлайн-демо-версия с возможностью настройки инструкций.
Источник: Bilibili ↗
