microsoft/Megatron-DeepSpeed

Ongoing research training transformer language models at scale, including: BERT & GPT-2

Обучение⭐ 2 264Pythonпоследний релиз: v2.4
Открыть на GitHub ↗

Что это за инструмент

Megatron-DeepSpeed — это форк NVIDIA Megatron-LM, интегрирующий возможности DeepSpeed для масштабного обучения трансформерных языковых моделей.

Зачем нужен

Инструмент предназначен для эффективного обучения LLM с миллиардами параметров на множестве GPU с использованием смешанной точности и параллелизма. Он полезен исследователям и инженерам, которым нужна высокая производительность (FLOPs utilization) и поддержка передовых архитектур, таких как MoE, на уровне, близком к линейному масштабированию.

Что можно реализовать

  • Pre-training больших языковых моделей (GPT, BERT, T5) с числом параметров от 1 млрд до 1 трлн.
  • Обучение моделей с архитектурой Mixture of Experts (MoE) с использованием 3D-параллелизма.
  • Исследование масштабируемости и эффективности обучения на суперкомпьютерах (например, NVIDIA Selene).
  • Разработка и тестирование кастомных рецептов для обучения на Azure ML или HPC-кластерах.

Ключевые возможности

  • Интеграция DeepSpeed с NVIDIA Megatron-LM (синхронизировано с upstream более чем на 1k коммитов).
  • Поддержка 3D-параллелизма (tensor, sequence, pipeline) и MoE-архитектур.
  • Доказанное линейное масштабирование до 1 трлн параметров на 3072 GPU A100.
  • Готовые примеры и скрипты для запуска на Azure и AzureML.
  • Высокая утилизация вычислительных ресурсов (MFU/HFU) при end-to-end обучении.

👤 Кому подойдёт: ML-инженеры, исследователи в области NLP, разработчики, работающие с крупными языковыми моделями (LLM) и требующие оптимизации обучения на GPU-кластерах.

Релизы