NVIDIA/Megatron-LM

Ongoing research training transformer models at scale

Обучение⭐ 17 959Pythonпоследний релиз: core_v0.19.2
Открыть на GitHub ↗Сайт проекта ↗

Что это за инструмент

Megatron-LM и Megatron Core — это оптимизированная для GPU библиотека NVIDIA для обучения трансформерных моделей (LLM) на масштабе, включающая готовые скрипты и набор низкоуровневых строительных блоков.

Зачем нужен

Инструмент решает задачу эффективного распределенного обучения больших языковых моделей, используя сложные стратегии параллелизма (TP, PP, DP, EP, CP) и поддержку смешанной точности (FP16, BF16, FP8, FP4). Он полезен для исследователей, которым нужны готовые решения для экспериментов, и для ML-инженеров, строящих кастомные пайплайны обучения с нуля.

Что можно реализовать

  • Обучение больших трансформерных моделей на кластерах NVIDIA GPU с использованием различных стратегий параллелизма
  • Разработка пользовательских фреймворков для обучения LLM с использованием модульных блоков Megatron Core
  • Конвертация чекпоинтов между форматами Hugging Face и Megatron с помощью Megatron Bridge
  • Исследование и внедрение новых архитектур, таких как MoE (Mixture of Experts) и гибридные модели (например, Falcon-H1)
  • Эксперименты с новыми оптимизаторами (например, Muon) и методами масштабирования контекста (Dynamic Context Parallelism)

Ключевые возможности

  • Два компонента: Megatron-LM (готовые скрипты для исследований) и Megatron Core (библиотека для кастомных фреймворков)
  • Поддержка передовых архитектур: DeepSeek-V4, Falcon-H1, GPT-OSS и MoE модели
  • Широкая поддержка точностей: FP16, BF16, FP8 и FP4 для оптимизации производительности
  • Интеграция с Hugging Face через Megatron Bridge для двусторонней конвертации чекпоинтов
  • Открытая разработка на GitHub с активной поддержкой сообщества и регулярными обновлениями

👤 Кому подойдёт: ML-инженеры, разработчики фреймворков, исследователи в области LLM, работающие с GPU NVIDIA

Релизы

core_v0.19.2minor
🕐 2 дн назад · релиз на GitHub ↗

Релиз Megatron Core v0.19.2: добавлена поддержка FP4 в 1F1B A2A overlap, обновлены зависимости Transformer Engine и Weights & Biases.

  • Added: Добавлена поддержка формата FP4 в перекрытии 1F1B A2A (All-to-All).
  • Added: Обновлен Transformer Engine до версии 2.18.0 и скорректированы зависимости.
  • Fixed: Исправлена ссылка на документацию API Transformer Engine.
  • Fixed: Реализована защита от предоставления шаблонов чата через запросы (reject request-supplied chat templates).
  • Обновлен Weights & Biases до версии 0.29.0.
core_v0.19.0minor
🕐 1 мес назад · релиз на GitHub ↗

Релиз Megatron-LM v0.19.0: улучшена поддержка MTP, исправлены ошибки MoE и FSDP, добавлены тесты для Blackwell и оптимизации производительности.

  • Added: Значительно расширена поддержка Multi-Token Prediction (MTP): добавлены метрики, настройка отключения голов, масштабирование градиентов и стабильная статистика кэширования.
  • Fixed: Исправлены критические ошибки в MoE: корректное масштабирование градиентов aux_loss/z_loss при тензорной параллельности (TP > 1) и исправление индексатора DSA.
  • Added: Добавлены тесты производительности и стабильности для архитектуры GB200/Blackwell, а также обновлены конфигурации для DeepSeek и Nemotron Ultra.
  • Fixed: Устранены проблемы с FSDP: исправлено разделение GDN DTensor для чекпоинтов и ошибка счётика Zero при разделённых градиентах.
  • Added: Оптимизации производительности: свёртка замороженных линейных операций, слияние AlltoAll в GDN и улучшение распределения CUDA-графов для смешанного префиллинга.
core_v0.18.2minor
🕐 2 мес назад · релиз на GitHub ↗

Обновление Megatron Core до v0.18.2: интеграция Flash MLA, Fast Hadamard Transform и обновление Transformer Engine.

  • Added: Добавлена поддержка Fast Hadamard Transform и интеграция Flash MLA.
  • Added: Обновлен Transformer Engine до версии release_v2.16.post.
  • Fixed: Отключена слияние функции потерь Cross Entropy в Transformer Engine.
  • Fixed: Параметр защиты Cross Entropy перенесен в аргументы обучения.
core_v0.18.0major
🕐 3 мес назад · релиз на GitHub ↗

Релиз Megatron-LM v0.18.0: масштабные улучшения FSDP, поддержка MXFP8, оптимизаторов и CUDA Graphs.

  • Added: Масштабное обновление Megatron-FSDP: добавлена поддержка MXFP8, гибридного FSDP, асинхронного сохранения чекпоинтов и оптимизации градиентов.
  • Added: Включена поддержка CUDA Graphs для оптимизатора Adam и улучшена работа с Mamba-моделями (offloading, тесты).
  • Added: Расширен список поддерживаемых оптимизаторов (Muon, emerging optimizers) и улучшена интеграция с vLLM для чат-комплитионов.
  • Fixed: Исправлены критические ошибки в FSDP (конвертация чекпоинтов, двойные буферы), MTP-инференсе и segfault при упаковке последовательностей.
  • Added: Улучшена CI/CD: добавлены навыки для Claude, исправлены лимиты rate limits и синхронизация со Slack.