AIKraft/Skills/NeMo mBridge (производительность): процесс оптимизации MoE

NeMo mBridge (производительность): процесс оптимизации MoE

Systematic workflow for MoE training optimization in Megatron Bridge, based on the Megatron-Core MoE paper. Covers the Three Walls framework, parallel folding, recompute strategy, dispatcher choice, and CUDA-graph bring-up.

nvidia official Другое

Что делает навык

Систематический процесс оптимизации обучения MoE в Megatron Bridge, основанный на статье Scalable Training of MoE Models with Megatron Core. Охватывает преодоление ограничений памяти, коммуникации и вычислений через итеративную настройку параллелизма, диспетчеров и графов CUDA.

Когда применять

  • Диагностика и устранение узких мест (memory, communication, compute, host overhead) при обучении MoE-моделей.
  • Настройка стратегии переиспользования активаций (recompute) для обеспечения вместимости модели в память.
  • Выбор оптимальной схемы параллелизма (Parallel Folding) для разделения конфигураций внимания и экспертных слоев.
  • Валидация производительности и корректности изменений через профилирование и сравнение A/B.

Как работает

  1. Заморозить контракт измерений: зафиксировать версии ПО, топологию, гиперпараметры и метрики, разделив изменения на training-equivalent и benchmark-only.
  2. Обеспечить работоспособность модели (Fit): выбрать минимальный параллелизм, включить selective recompute, при необходимости добавить offloading.
  3. Масштабировать (Scale): максимизировать DP, использовать PP/VPP для мультинод, предпочесть EP над TP для экспертных слоев, применить Parallel Folding.
  4. Профилировать (Profile): определить доминирующее узкое место (память, коммуникация, хост или вычисления) с помощью Nsight и анализа пересечений интервалов.
  5. Настроить (Retune): изменить одну переменную на основе профиля, подобрав диспетчер (alltoall, flex+deepep, flex+hybridep), перекрытия и точность (FP8).
  6. Валидировать (Validate): запустить минимум 50 шагов в стабильном режиме, проверить TFLOPS/GPU, потерю, NaN и наличие целевых ядра в логах.

Примеры запросов агенту

Проведи оптимизацию обучения MoE Qwen3 30B-A3B на 16xH100, начиная с заморозки контракта измерений и профилирования узких мест.
Настрой Parallel Folding для модели, где слои внимания и эксперты требуют разного параллелизма, и выбери диспетчер на основе профиля коммуникаций.
Оптимизируй пропускную способность MoE-модели, перейдя от BF16 к FP8 и внедрив CUDA-графики только после профилирования накладных расходов хоста.

Что понадобится

  • Репозиторий skills (nvidia/skills) с доступом к @skills/nemo-mbridge-perf-moe-optimization-workflow/card.yaml и docs/training/moe-optimization.md
  • Среда NVIDIA NeMo Bridge / Megatron Core с установленными пакетами DeepEP или HybridEP
  • Инструменты профилирования (например, Nsight) и доступ к GPU-топологии (NVLink, NVL8, NVL72)

Описание составлено по SKILL.md навыка, сверено 05.10.2026.

Как подключить

1Скачать навык
# возьмите папку навыка «nemo-mbridge-perf-moe-optimization-workflow» из репозитория: # https://github.com/nvidia/skills
2Положить папку с SKILL.md к навыкам ассистента
# положите папку навыка туда, где ассистент ищет skills: cp -r nemo-mbridge-perf-moe-optimization-workflow/ ~/.claude/skills/nemo-mbridge-perf-moe-optimization-workflow/

Навык — папка с файлом SKILL.md (описание + инструкции) и опциональными скриптами. Ассистент (Claude, Claude Code и совместимые) подхватывает его по описанию и следует шагам.