Архитектура и эффективность
AMD представила Instella-MoE-16B-A3B — языковую модель с архитектурой Mixture-of-Experts (MoE), обученную с нуля на GPU Instinct MI300X и MI325X в среде ROCm. Модель содержит 16 миллиардов параметров, но для обработки каждого токена активируется лишь 2.8 миллиарда. Это достигается за счет использования 2 общих экспертов и 6 маршрутизируемых экспертов, выбираемых из пула в 64 эксперта.
Ключевые архитектурные особенности:
- Gated Multi-head Latent Attention (Gated MLA): добавляет легкий обучаемый выходной гейт к механизму внимания, что улучшает качество вывода.
- FarSkip-Collective: технология, позволяющая передавать устаревшие и частичные активации в слои MoE и внимания, перекрывая коммуникацию экспертов с вычислениями. Это дало прирост скорости обучения на 12.7% и сокращение времени до первого токена (TTFT) на 39.2% при сервинге.
Обучение и данные
Процесс обучения был разделен на несколько этапов с использованием различных датасетов:
- Pre-training: 7.1 трлн токенов из открытых корпусов (Nemotron-CC-v2, MegaMath, FineMath, RefineCode, TxT360).
- Mid-training: использование Dolma3 и Dolmino 100B с усреднением весов.
- Long-context: расширение контекстного окна с 4K до 64K токенов с помощью YaRN и увеличенного RoPE theta.
- Post-training: SFT на Dolci-Think-SFT-7B, DPO с обновлением смещения маршрутизатора и RL-оптимизация в фреймворке Miles (1,400 шагов RLVR + Multi-Teacher On-Policy Distillation).
Результаты бенчмарков
Instella-MoE-16B показывает сильные результаты, особенно в сравнении с другими полностью открытыми моделями. Ниже приведено сравнение базовых и пост-обученных версий:
| Модель | Базовый балл (Avg) | Think/Post-train балл | HumanEval+ | WinoGrande |
|---|---|---|---|---|
| Instella-MoE-16B-A3B (Base) | 76.7 | - | 65.7 | 86.5 |
| Instella-MoE-16B-A3B (Think) | - | 73.22 | - | - |
| Moonlight-16B-A3B | 76.2 | - | - | - |
| SmolLM3-3B-Base | 70.5 | - | - | - |
| Qwen3.5-4B-Base | 79.5 | 69.73 | - | - |
| Olmo3-7B-Think | - | 71.97 | - | - |
Модель также демонстрирует отличные результаты на длинных контекстах: 41.5 на HELMET и 79.4 на RULER. После пост-обучения (SFT → DPO → Think) общий балл вырос с 71.58 до 73.22, а способность к выполнению инструкций (IFEval) увеличилась с 77.08 до 83.70.
Лицензирование и развертывание
Важно отметить ограничения: веса модели распространяются под лицензией ResearchRAIL, что разрешает использование только для академических и исследовательских целей. Однако код обучения доступен под лицензией MIT, что делает его ценным активом для разработчиков.
Для инференса AMD предоставляет код на базе SGLang. Модель требует около 32 ГБ памяти для весов в BF16, что позволяет запускать её на одном высокопроизводительном ускорителе. Это решение ориентировано на исследовательские лаборатории, университетские группы и R&D-отделы предприятий, обладающих инфраструктурой на базе AMD Instinct.
Бенчмарки
| Бенчмарк | Instella-MoE-16B-A3B | Instella-MoE-16B-A3B (Think) | Gemma-4-E4B think | Moonlight-16B-A3B | OLMo-3-7B | Olmo3-7B-Think | Qwen3.5-4B | SmolLM3-3B-Base |
|---|---|---|---|---|---|---|---|---|
| Average (Base) | 76.7% | — | — | 76.2% | 70.1% | — | — | 70.5% |
| IFEval | — | 83.7% | 70.47% | — | — | 71.97% | 69.73% | — |
Жирным — лучший результат в строке. Источник цифр — официальная публикация.
Источник: MarkTechPost ↗
