NeMo mBridge (производительность): перекрытие expert-параллелизма
Validate and use MoE expert-parallel communication overlap in Megatron-Bridge, including overlap_moe_expert_parallel_comm, delay_wgrad_compute, and flex dispatcher backends such as DeepEP and HybridEP.
Что делает навык
Навык обеспечивает перекрытие коммуникаций (dispatch/combine) и вычислений экспертных FFN в MoE-моделях с Expert-Parallelism (EP) через Megatron-Bridge. Он скрывает накладные расходы на all-to-all коммуникации, запуская их параллельно с вычислениями, и опционально использует отложенное вычисление градиентов весов (delay_wgrad_compute) для дополнительного перекрытия. Поддерживаются диспетчеры alltoall (по умолчанию) и flex (DeepEP/HybridEP) для повышения пропускной способности.
Когда применять
- Оптимизация производительности MoE-моделей (например, Qwen3 30B-A3B) на GPU Ampere, Hopper, Blackwell при EP > 1.
- Ускорение шага обучения за счет скрытия времени коммуникации экспертного диспетчинга параллельно с вычислениями.
- Использование высокопроизводительных бэкендов диспетчеризации DeepEP или HybridEP на поддерживаемых архитектурах NVIDIA.
- Валидация корректности и производительности конфигураций MoE перед развертыванием в продакшене.
Как работает
- Проверить соответствие модели требованиям: EP > 1, num_moe_experts > 1, точность BF16/FP16, PyTorch >= 2.6.0 и отсутствие full activation recompute.
- Настроить базовый диспетчер alltoall, установив overlap_moe_expert_parallel_comm = True и moe_token_dispatcher_type = 'alltoall'.
- Запустить изолированный бенчмарк plain EP overlap, отключив delay_wgrad_compute и flex-диспетчеры для чистого измерения эффекта.
- При необходимости переключиться на flex-диспетчер (DeepEP или HybridEP), вызвав apply_flex_dispatcher_backend и убедившись в поддержке GPU.
- Опционально включить delay_wgrad_compute = True только после успешной проверки plain overlap и проверки совместимости с CUDA graphs и TE.
- Верифицировать результат через unit-тесты (test_comm_overlap.py, test_deepep.py) и проверку логов на отсутствие assertion errors.
Примеры запросов агенту
Что понадобится
- Megatron-Bridge и PyTorch версии >= 2.6.0
- GPU архитектуры Ampere, Hopper, Blackwell (для DeepEP/HybridEP)
- Библиотека Transformer Engine (версии >= 2.7.0 или >= 2.12.0 в зависимости от настроек)
Описание составлено по SKILL.md навыка, сверено 05.10.2026.
Как подключить
SKILL.md к навыкам ассистентаНавык — папка с файлом SKILL.md (описание + инструкции) и опциональными скриптами. Ассистент (Claude, Claude Code и совместимые) подхватывает его по описанию и следует шагам.