Релиз модели1 октября 2026 г., 18:19 МСК🤖 Auto

Olmo-core 3: Открытый стек для обучения MoE на 1+ трлн параметров

Allen AI представил Olmo-core 3 — переработанную инфраструктуру для обучения смешанных моделей (MoE). Система поддерживает масштабирование до 2.38 трлн параметров и обеспечивает рост пропускной способности в 2.7 раза по сравнению с предыдущей версией

Баннер новости 8705

Прорыв в масштабируемости и производительности

Allen Institute for AI (AI2) выпустил Olmo-core 3, ключевой компонент для обучения будущих моделей Olmo. Главная особенность системы — эффективная работа с архитектурами Mixture-of-Experts (MoE) в диапазоне триллионов параметров. В отличие от предыдущих версий, использующих FSDP, новый стек базируется на Distributed Data Parallelism (DDP), что позволяет хранить экспертов на GPU и маршрутизировать данные, избегая лишних операций сбора весов.

Ключевые метрики производительности на базе NVIDIA B300:

  • Рост пропускной способности: На модели с 47 млрд параметров скорость обработки выросла с 19,400 до 52,000 токенов в секунду на GPU (рост в 2.7 раза).
  • Масштабирование пула экспертов: Увеличение пула с 8 до 128 экспертов при выборе 4-х на токен. Активные параметры остаются ~3.2B, а общая емкость модели выросла с 4.6B до 47B при падении пропускной способности менее чем на 5%.
  • Максимальный масштаб: Протестирована конфигурация с 2.38 трлн параметров (с использованием DeepEP v2) и 1.2 трлн параметров с 58.36 млрд активных параметров на 512 GPU.

Технические оптимизации: от MXFP8 до маршрутизации

Olmo-core 3 внедряет комплексный подход к распределению вычислений. Система использует три уровня параллелизма: экспертный, конвейерный и распределенный оптимизатор. Для снижения накладных расходов на маршрутизацию применены rowwise expert parallelism и GPU-resident routing, а для ускорения вычислений — grouped GEMM.

Особое внимание уделено форматам данных. Поддержка MXFP8 (низкоточный формат) позволила повысить общую пропускную способность обучения на 21% по сравнению с BF16 и снизить пиковое потребление памяти с 103 GiB до 95 GiB на четырех GPU B300. Основной прирост обеспечили операции feed-forward и перемещение данных между экспертами.

Сравнение производительности Olmo-core

Метрика / Конфигурация Olmo-core (предыдущая версия / FSDP) Olmo-core 3 (DDP + оптимизации)
Пропускная способность (47B params, 8x B300) 19,400 токенов/сек/GPU 52,000 токенов/сек/GPU
Общая емкость модели (при фикс. активных params) 4.6B 47B
Потребление памяти (MXFP8 vs BF16, 4x B300) 103 GiB (BF16 baseline) 95 GiB (MXFP8 enabled)
Рост эффективности (MXFP8) — +21% к throughput

Инсайды из технического отчета: ошибки и компромиссы

Исследователи также опубликовали важные выводы о том, чего следует избегать при обучении гигантских MoE. Выявлен феномен "token gerrymandering" (манипуляция токенами), когда метрики баланса маршрутизации улучшаются, но реальная нагрузка становится дисбалансной. Также выяснилось, что снижение скорости обучения (learning rate) для экспертов, обрабатывающих меньше токенов, не дало прироста качества. Важно отметить, что простое наложение коммуникации и вычислений на разные потоки GPU не всегда ускоряет обучение — в некоторых тестах это даже замедляло процесс.

Значение для сообщества

Olmo-core 3 становится фундаментом для следующего поколения моделей Olmo, которые обещают стать самыми мощными в линейке благодаря использованию MoE-архитектуры, крупнейшему датасету и увеличенному контекстному окну. Открытость инфраструктуры позволяет академическим исследователям и небольшим лабораториям экспериментировать с моделями триллионного масштаба, снижая барьер входа в разработку передовых LLM.

Источник: Hugging Face blog ↗