Инструменты30 июля 2026 г., 14:17 МСК🤖 Auto

Moonshot AI открыл MoonEP: библиотека для идеального балансирования MoE

Moonshot AI выпустила MoonEP — библиотеку экспертного параллелизма, обеспечивающую равномерное распределение токенов между GPU. Технология стала ключом к 2.5-кратному ускорению обучения модели Kimi K3.

Баннер новости 4718

Решение проблемы дисбаланса в MoE-моделях

Компания Moonshot AI открыла исходный код библиотеки MoonEP под лицензией MIT. Это решение разработано специально для распределенных вычислений в архитектурах Mixture-of-Experts (MoE). Главная проблема, которую решает MoonEP, — дисбаланс нагрузки: маршрутизатор часто отправляет непропорционально много токенов на некоторые GPU, что создает «узкие места» и замедляет весь кластер.

Для количественной оценки дисбаланса используется метрика maxvio, определяемая как max_e (T_e / T̄) − 1. В традиционных системах (например, DeepEP v2) задержка коллективных операций определяется самым загруженным рангом, что приводит к деградации производительности при росте дисбаланса.

Архитектурные инновации MoonEP

Ключевая особенность MoonEP — гарантия идеального баланса: каждый ранг получает ровно S × K токенов, независимо от того, как сбалансирован маршрутизатор. Это достигается за счет:

  • Динамических избыточных экспертов: система онлайн-планирует дублирование экспертов прямо на GPU, используя ядро планирования на базе CUTLASS CuTe DSL.
  • Zero-copy коммуникации: токены записываются напрямую в позиции, сгруппированные по экспертам, исключая лишнее копирование буферов.
  • Статических форм: фиксированный размер буфера S × K устраняет необходимость синхронизации хоста на каждом слое и предотвращает фрагментацию памяти GPU.

Технические спецификации и требования

Библиотека требует строгого соблюдения контракта с фреймворком: один непрерывный тензор весов на проекцию эксперта и массив cu_seqlens. Объем дополнительной памяти зависит от режима работы:

Параметр Режим обучения (Training) Режим вывода (Inference)
Количество слотов предвыборки (B) B = E/R (E — всего экспертов, R — ранги) B = 3–4 (рекомендуемое значение)
Размер весов для GEMM [E+B, H, H'] (H — скрытый размер, H' — промежуточный размер FFN)
Обработка градиентов Градиенты дублированных экспертов накапливаются в отдельных буферах, не затрагивая основные параметры

Результаты бенчмарков

Сравнение проводилось на GPU NVIDIA H20 с экспертным параллелизмом EP=8. Базовая конфигурация: S=8192, E=384, H=7168, K=8, H'=2048. Тесты показали, что MoonEP сохраняет стабильное время коммуникации при росте дисбаланса (maxvio от 0.2 до 20), в то время как DeepEP v2 демонстрирует линейную деградацию.

Значение для индустрии

Внедрение MoonEP позволило Moonshot AI достичь улучшения масштабируемости в 2.5 раза для модели Kimi K3 — MoE-модели с 2.8 триллионами параметров, нативным зрением и контекстным окном в 1 млн токенов. Библиотека выпущена в рамках Kimi K3 Open Day вместе с FlashKDA и AgentEnv, что делает экосистему Moonshot более доступной для исследователей и разработчиков.

Источник: MarkTechPost ↗