NeMo mBridge (производительность): длинный контекст MoE
Long-context MoE training guidance for Megatron Bridge. Covers CP sizing, selective recompute, dispatcher choices, and practical patterns from DSV3, Qwen3, and Qwen3-Next long-context experiments.
Что делает навык
Набор рекомендаций по оптимизации обучения MoE-моделей с длинным контекстом (Megatron Bridge), решающий проблемы доминирующих ограничений памяти и активаций при длине последовательности свыше 4K. Включает правила подбора размерности контекстного параллелизма (CP), выбора диспетчера маршрутизации и паттерны перекомputation для поддержания эффективности.
Когда применять
- Настройка конфигурации обучения DSV3 или Qwen3 на GPU H100/GB200 для контекста 128K–256K
- Балансировка распределения параллелизма (TP, CP, EP, PP) для предотвращения исчерпания бюджета DP
- Выбор стратегии перекомputation (selective vs full) для снижения потребления памяти активаций
- Интеграция CUDA Graphs для стабильных форм тензоров и маршрутизации MoE
Как работает
- Определите целевой размер шара контекста (4K) и рассчитайте начальное значение CP как seq_len / 4096, округлив до степени двойки
- Настройте параллелизм так, чтобы сохранить ненулевой бюджет DP, избегая одновременного сжатия TP, CP, EP и PP
- Включите selective recompute для модулей up_proj, norm, moe, moe_act или mlp, избегая перекомputation attention internals на длинных контекстах
- Выберите диспетчер (DeepEP или HybridEP) и настройте layout PP/VPP в зависимости от архитектуры (DSV3 или Qwen3)
- При использовании CUDA Graphs зафиксируйте длину последовательности и размер мини-батча, добавляя их только после стабилизации форм и маршрутизации
- При необходимости примените CPU offload для состояния оптимизатора и снизьте глобальный размер батча (GBS) или увеличьте градиентную аккумуляцию (GA)
Примеры запросов агенту
Что понадобится
- Доступ к репозиторию NVIDIA skills (nemo-mbridge-perf-moe-long-context)
- Документация @docs/training/moe-optimization.md и @docs/training/activation-recomputation.md
- Оборудование NVIDIA H100 или GB200/GB300 с поддержкой соответствующих ядер (FP8, MXFP8, DeepEP, HybridEP)
Описание составлено по SKILL.md навыка, сверено 05.10.2026.
Как подключить
SKILL.md к навыкам ассистентаНавык — папка с файлом SKILL.md (описание + инструкции) и опциональными скриптами. Ассистент (Claude, Claude Code и совместимые) подхватывает его по описанию и следует шагам.