Релиз модели2 августа 2026 г., 00:17 МСК🤖 Auto

AMD Instella-MoE-16B: 2.8B активных параметров и рекорд среди open-source

AMD выпустила полностью открытую MoE-модель Instella-MoE-16B-A3B, обученную на GPU Instinct. Модель демонстрирует лучшие результаты среди открытых аналогов, используя инновационные архитектуры Gated MLA и FarSkip-Collective.

Баннер новости 4890

Архитектура и эффективность

AMD представила Instella-MoE-16B-A3B — языковую модель с архитектурой Mixture-of-Experts (MoE), обученную с нуля на GPU Instinct MI300X и MI325X в среде ROCm. Модель содержит 16 миллиардов параметров, но для обработки каждого токена активируется лишь 2.8 миллиарда. Это достигается за счет использования 2 общих экспертов и 6 маршрутизируемых экспертов, выбираемых из пула в 64 эксперта.

Ключевые архитектурные особенности:

  • Gated Multi-head Latent Attention (Gated MLA): добавляет легкий обучаемый выходной гейт к механизму внимания, что улучшает качество вывода.
  • FarSkip-Collective: технология, позволяющая передавать устаревшие и частичные активации в слои MoE и внимания, перекрывая коммуникацию экспертов с вычислениями. Это дало прирост скорости обучения на 12.7% и сокращение времени до первого токена (TTFT) на 39.2% при сервинге.

Обучение и данные

Процесс обучения был разделен на несколько этапов с использованием различных датасетов:

  • Pre-training: 7.1 трлн токенов из открытых корпусов (Nemotron-CC-v2, MegaMath, FineMath, RefineCode, TxT360).
  • Mid-training: использование Dolma3 и Dolmino 100B с усреднением весов.
  • Long-context: расширение контекстного окна с 4K до 64K токенов с помощью YaRN и увеличенного RoPE theta.
  • Post-training: SFT на Dolci-Think-SFT-7B, DPO с обновлением смещения маршрутизатора и RL-оптимизация в фреймворке Miles (1,400 шагов RLVR + Multi-Teacher On-Policy Distillation).

Результаты бенчмарков

Instella-MoE-16B показывает сильные результаты, особенно в сравнении с другими полностью открытыми моделями. Ниже приведено сравнение базовых и пост-обученных версий:

Модель Базовый балл (Avg) Think/Post-train балл HumanEval+ WinoGrande
Instella-MoE-16B-A3B (Base) 76.7 - 65.7 86.5
Instella-MoE-16B-A3B (Think) - 73.22 - -
Moonlight-16B-A3B 76.2 - - -
SmolLM3-3B-Base 70.5 - - -
Qwen3.5-4B-Base 79.5 69.73 - -
Olmo3-7B-Think - 71.97 - -

Модель также демонстрирует отличные результаты на длинных контекстах: 41.5 на HELMET и 79.4 на RULER. После пост-обучения (SFT → DPO → Think) общий балл вырос с 71.58 до 73.22, а способность к выполнению инструкций (IFEval) увеличилась с 77.08 до 83.70.

Лицензирование и развертывание

Важно отметить ограничения: веса модели распространяются под лицензией ResearchRAIL, что разрешает использование только для академических и исследовательских целей. Однако код обучения доступен под лицензией MIT, что делает его ценным активом для разработчиков.

Для инференса AMD предоставляет код на базе SGLang. Модель требует около 32 ГБ памяти для весов в BF16, что позволяет запускать её на одном высокопроизводительном ускорителе. Это решение ориентировано на исследовательские лаборатории, университетские группы и R&D-отделы предприятий, обладающих инфраструктурой на базе AMD Instinct.

Бенчмарки

БенчмаркInstella-MoE-16B-A3BInstella-MoE-16B-A3B (Think)Gemma-4-E4B thinkMoonlight-16B-A3BOLMo-3-7BOlmo3-7B-ThinkQwen3.5-4BSmolLM3-3B-Base
Average (Base)76.7%76.2%70.1%70.5%
IFEval83.7%70.47%71.97%69.73%

Жирным — лучший результат в строке. Источник цифр — официальная публикация.

Источник: MarkTechPost ↗