Вышла версия v2.4.
microsoft/Megatron-DeepSpeed
Ongoing research training transformer language models at scale, including: BERT & GPT-2
Обучение⭐ 2 264Pythonпоследний релиз: v2.4
Что это за инструмент
Megatron-DeepSpeed — это форк NVIDIA Megatron-LM, интегрирующий возможности DeepSpeed для масштабного обучения трансформерных языковых моделей.
Зачем нужен
Инструмент предназначен для эффективного обучения LLM с миллиардами параметров на множестве GPU с использованием смешанной точности и параллелизма. Он полезен исследователям и инженерам, которым нужна высокая производительность (FLOPs utilization) и поддержка передовых архитектур, таких как MoE, на уровне, близком к линейному масштабированию.
Что можно реализовать
- Pre-training больших языковых моделей (GPT, BERT, T5) с числом параметров от 1 млрд до 1 трлн.
- Обучение моделей с архитектурой Mixture of Experts (MoE) с использованием 3D-параллелизма.
- Исследование масштабируемости и эффективности обучения на суперкомпьютерах (например, NVIDIA Selene).
- Разработка и тестирование кастомных рецептов для обучения на Azure ML или HPC-кластерах.
Ключевые возможности
- Интеграция DeepSpeed с NVIDIA Megatron-LM (синхронизировано с upstream более чем на 1k коммитов).
- Поддержка 3D-параллелизма (tensor, sequence, pipeline) и MoE-архитектур.
- Доказанное линейное масштабирование до 1 трлн параметров на 3072 GPU A100.
- Готовые примеры и скрипты для запуска на Azure и AzureML.
- Высокая утилизация вычислительных ресурсов (MFU/HFU) при end-to-end обучении.
👤 Кому подойдёт: ML-инженеры, исследователи в области NLP, разработчики, работающие с крупными языковыми моделями (LLM) и требующие оптимизации обучения на GPU-кластерах.
Релизы
v2.4patch