DeepEP — это высокопроизводительная библиотека для коммуникации между GPU, специализирующаяся на экспертной параллелизации (Expert Parallelism) для MoE-моделей.
Зачем нужен
Инструмент оптимизирует операции all-to-all (dispatch и combine), обеспечивая высокую пропускную способность и низкую задержку с поддержкой FP8. Он позволяет эффективно масштабировать обучение и инференс MoE-моделей, минимизируя использование ресурсов GPU (SM).
Что можно реализовать
Ускорение обучения и инференса больших MoE-моделей (например, Mixtral, DeepSeek) за счет оптимизации меж-GPU коммуникации.
Масштабирование кластеров до EP2048 с использованием NCCL Gin бэкенда для internode-коммуникации через RDMA.
Экспериментальное использование pipeline parallelism (PP) и context parallelism (CP) с нулевым использованием SM.
Интеграция в пайплайны обучения с использованием JIT-компиляции ядер без необходимости предварительной сборки CUDA.
Ключевые возможности
Архитектура V2: до 1.3x прирост производительности и экономия до 4x SM-ресурсов по сравнению с V1.
Полная JIT-компиляция ядер, исключающая этап CUDA-компиляции при установке.
Поддержка NCCL Gin бэкенда (header-only, легковесный) и отказ от NVSHMEM в основной ветке.
Единый интерфейс ElasticBuffer для унификации high-throughput и low-latency режимов.
Аналитический расчет количества SM и QP, устраняющий необходимость в авто-тюнинге.
👤 Кому подойдёт: Инженеры по машинному обучению, разработчики фреймворков для распределенного обучения и исследователи, работающие с крупными MoE-моделями на GPU-кластерах.