AIKraft/Skills/NeMo mBridge (производительность): перекрытие expert-параллелизма

NeMo mBridge (производительность): перекрытие expert-параллелизма

Validate and use MoE expert-parallel communication overlap in Megatron-Bridge, including overlap_moe_expert_parallel_comm, delay_wgrad_compute, and flex dispatcher backends such as DeepEP and HybridEP.

nvidia official Другое

Что делает навык

Навык обеспечивает перекрытие коммуникаций (dispatch/combine) и вычислений экспертных FFN в MoE-моделях с Expert-Parallelism (EP) через Megatron-Bridge. Он скрывает накладные расходы на all-to-all коммуникации, запуская их параллельно с вычислениями, и опционально использует отложенное вычисление градиентов весов (delay_wgrad_compute) для дополнительного перекрытия. Поддерживаются диспетчеры alltoall (по умолчанию) и flex (DeepEP/HybridEP) для повышения пропускной способности.

Когда применять

  • Оптимизация производительности MoE-моделей (например, Qwen3 30B-A3B) на GPU Ampere, Hopper, Blackwell при EP > 1.
  • Ускорение шага обучения за счет скрытия времени коммуникации экспертного диспетчинга параллельно с вычислениями.
  • Использование высокопроизводительных бэкендов диспетчеризации DeepEP или HybridEP на поддерживаемых архитектурах NVIDIA.
  • Валидация корректности и производительности конфигураций MoE перед развертыванием в продакшене.

Как работает

  1. Проверить соответствие модели требованиям: EP > 1, num_moe_experts > 1, точность BF16/FP16, PyTorch >= 2.6.0 и отсутствие full activation recompute.
  2. Настроить базовый диспетчер alltoall, установив overlap_moe_expert_parallel_comm = True и moe_token_dispatcher_type = 'alltoall'.
  3. Запустить изолированный бенчмарк plain EP overlap, отключив delay_wgrad_compute и flex-диспетчеры для чистого измерения эффекта.
  4. При необходимости переключиться на flex-диспетчер (DeepEP или HybridEP), вызвав apply_flex_dispatcher_backend и убедившись в поддержке GPU.
  5. Опционально включить delay_wgrad_compute = True только после успешной проверки plain overlap и проверки совместимости с CUDA graphs и TE.
  6. Верифицировать результат через unit-тесты (test_comm_overlap.py, test_deepep.py) и проверку логов на отсутствие assertion errors.

Примеры запросов агенту

Включи перекрытие коммуникаций expert-parallel для модели Qwen3 30B-A3B на 16 H100, используя диспетчер alltoall.
Настрой использование бэкенда DeepEP для перекрытия коммуникаций MoE и проверь совместимость с текущей архитектурой GPU.
Запусти бенчмарк изоляции plain EP overlap, отключив отложенное вычисление градиентов, чтобы оценить чистый прирост скорости.

Что понадобится

  • Megatron-Bridge и PyTorch версии >= 2.6.0
  • GPU архитектуры Ampere, Hopper, Blackwell (для DeepEP/HybridEP)
  • Библиотека Transformer Engine (версии >= 2.7.0 или >= 2.12.0 в зависимости от настроек)

Описание составлено по SKILL.md навыка, сверено 05.10.2026.

Как подключить

1Скачать навык
# возьмите папку навыка «nemo-mbridge-perf-expert-parallel-overlap» из репозитория: # https://github.com/nvidia/skills
2Положить папку с SKILL.md к навыкам ассистента
# положите папку навыка туда, где ассистент ищет skills: cp -r nemo-mbridge-perf-expert-parallel-overlap/ ~/.claude/skills/nemo-mbridge-perf-expert-parallel-overlap/

Навык — папка с файлом SKILL.md (описание + инструкции) и опциональными скриптами. Ассистент (Claude, Claude Code и совместимые) подхватывает его по описанию и следует шагам.