AIKraft/Skills/NeMo mBridge (производительность): иерархический контекстный параллелизм

NeMo mBridge (производительность): иерархический контекстный параллелизм

Operational guide for enabling hierarchical context parallelism in Megatron-Bridge, including config knobs, code anchors, pitfalls, and verification.

nvidia official Разработка

Что делает навык

Настройка иерархического контекстного параллелизма (hierarchical context parallelism) в Megatron-Bridge с использованием типа коммуникации cp_comm_type="a2a+p2p". Skill обеспечивает корректную конфигурацию вложенных групп процессов через параметр hierarchical_context_parallel_sizes для оптимизации распределения вычислений.

Когда применять

  • Включение иерархического параллелизма для ускорения обучения больших моделей с учетом ограничений последовательности.
  • Настройка конфигурации Bridge для использования типа коммуникации a2a+p2p вместо чистого a2a или p2p.
  • Диагностика и исправление ошибок конфигурации, таких как несоответствие произведения размеров иерархического параллелизма общему размеру CP.
  • Проверка логов инициализации для подтверждения активации иерархических групп контекстного параллелизма.

Как работает

  1. Установить параметр cfg.model.cp_comm_type в значение "a2a+p2p".
  2. Задать список размеров уровней в cfg.model.hierarchical_context_parallel_sizes так, чтобы их произведение равнялось cfg.model.context_parallel_size.
  3. Убедиться, что длина последовательности (seq_length) делится на 2 * context_parallel_size без остатка.
  4. Проверить, что версия Transformer Engine не ниже 1.12.0.
  5. Запустить обучение и проверить логи на наличие сообщения о создании HIERARCHICAL_CONTEXT_PARALLEL_GROUPS.
  6. Выполнить unit-тесты для проверки корректности работы, например, test_decentralized_pg.py.

Примеры запросов агенту

Как настроить иерархический контекстный параллелизм для 4 GPU с типом коммуникации a2a+p2p?
Проверь конфигурацию Bridge: правильно ли заданы размеры иерархического параллелизма для context_parallel_size=4?
Почему обучение может работать с искусственно завышенной пропускной способностью, если не заданы hierarchical_context_parallel_sizes?

Что понадобится

  • Transformer Engine версии >= 1.12.0
  • Доступ к репозиторию NVIDIA skills и Megatron-Bridge

Описание составлено по SKILL.md навыка, сверено 05.10.2026.

Как подключить

1Скачать навык
# возьмите папку навыка «nemo-mbridge-perf-hierarchical-context-parallel» из репозитория: # https://github.com/nvidia/skills
2Положить папку с SKILL.md к навыкам ассистента
# положите папку навыка туда, где ассистент ищет skills: cp -r nemo-mbridge-perf-hierarchical-context-parallel/ ~/.claude/skills/nemo-mbridge-perf-hierarchical-context-parallel/

Навык — папка с файлом SKILL.md (описание + инструкции) и опциональными скриптами. Ассистент (Claude, Claude Code и совместимые) подхватывает его по описанию и следует шагам.