AIKraft/Skills/NeMo mBridge (производительность): длинный контекст MoE

NeMo mBridge (производительность): длинный контекст MoE

Long-context MoE training guidance for Megatron Bridge. Covers CP sizing, selective recompute, dispatcher choices, and practical patterns from DSV3, Qwen3, and Qwen3-Next long-context experiments.

nvidia official Другое

Что делает навык

Набор рекомендаций по оптимизации обучения MoE-моделей с длинным контекстом (Megatron Bridge), решающий проблемы доминирующих ограничений памяти и активаций при длине последовательности свыше 4K. Включает правила подбора размерности контекстного параллелизма (CP), выбора диспетчера маршрутизации и паттерны перекомputation для поддержания эффективности.

Когда применять

  • Настройка конфигурации обучения DSV3 или Qwen3 на GPU H100/GB200 для контекста 128K–256K
  • Балансировка распределения параллелизма (TP, CP, EP, PP) для предотвращения исчерпания бюджета DP
  • Выбор стратегии перекомputation (selective vs full) для снижения потребления памяти активаций
  • Интеграция CUDA Graphs для стабильных форм тензоров и маршрутизации MoE

Как работает

  1. Определите целевой размер шара контекста (4K) и рассчитайте начальное значение CP как seq_len / 4096, округлив до степени двойки
  2. Настройте параллелизм так, чтобы сохранить ненулевой бюджет DP, избегая одновременного сжатия TP, CP, EP и PP
  3. Включите selective recompute для модулей up_proj, norm, moe, moe_act или mlp, избегая перекомputation attention internals на длинных контекстах
  4. Выберите диспетчер (DeepEP или HybridEP) и настройте layout PP/VPP в зависимости от архитектуры (DSV3 или Qwen3)
  5. При использовании CUDA Graphs зафиксируйте длину последовательности и размер мини-батча, добавляя их только после стабилизации форм и маршрутизации
  6. При необходимости примените CPU offload для состояния оптимизатора и снизьте глобальный размер батча (GBS) или увеличьте градиентную аккумуляцию (GA)

Примеры запросов агенту

Как настроить CP и recompute для обучения DSV3 с контекстом 128K на H100?
Какие параметры TP, CP, EP и PP выбрать для Qwen3 235B на GB200 при длине 128K?
Почему падает throughput при увеличении контекста с 32K до 64K для Qwen3-Next и как это исправить?

Что понадобится

  • Доступ к репозиторию NVIDIA skills (nemo-mbridge-perf-moe-long-context)
  • Документация @docs/training/moe-optimization.md и @docs/training/activation-recomputation.md
  • Оборудование NVIDIA H100 или GB200/GB300 с поддержкой соответствующих ядер (FP8, MXFP8, DeepEP, HybridEP)

Описание составлено по SKILL.md навыка, сверено 05.10.2026.

Как подключить

1Скачать навык
# возьмите папку навыка «nemo-mbridge-perf-moe-long-context» из репозитория: # https://github.com/nvidia/skills
2Положить папку с SKILL.md к навыкам ассистента
# положите папку навыка туда, где ассистент ищет skills: cp -r nemo-mbridge-perf-moe-long-context/ ~/.claude/skills/nemo-mbridge-perf-moe-long-context/

Навык — папка с файлом SKILL.md (описание + инструкции) и опциональными скриптами. Ассистент (Claude, Claude Code и совместимые) подхватывает его по описанию и следует шагам.