deepseek-ai/DeepEP

DeepEP: эффективная библиотека коммуникации для экспертного параллелизма

Инструменты⭐ 10 173Cudaпоследний релиз: v1.2.1
Открыть на GitHub ↗

Что это за инструмент

DeepEP — это высокопроизводительная библиотека для коммуникации между GPU, специализирующаяся на экспертной параллелизации (Expert Parallelism) для MoE-моделей.

Зачем нужен

Инструмент оптимизирует операции all-to-all (dispatch и combine), обеспечивая высокую пропускную способность и низкую задержку с поддержкой FP8. Он позволяет эффективно масштабировать обучение и инференс MoE-моделей, минимизируя использование ресурсов GPU (SM).

Что можно реализовать

  • Ускорение обучения и инференса больших MoE-моделей (например, Mixtral, DeepSeek) за счет оптимизации меж-GPU коммуникации.
  • Масштабирование кластеров до EP2048 с использованием NCCL Gin бэкенда для internode-коммуникации через RDMA.
  • Экспериментальное использование pipeline parallelism (PP) и context parallelism (CP) с нулевым использованием SM.
  • Интеграция в пайплайны обучения с использованием JIT-компиляции ядер без необходимости предварительной сборки CUDA.

Ключевые возможности

  • Архитектура V2: до 1.3x прирост производительности и экономия до 4x SM-ресурсов по сравнению с V1.
  • Полная JIT-компиляция ядер, исключающая этап CUDA-компиляции при установке.
  • Поддержка NCCL Gin бэкенда (header-only, легковесный) и отказ от NVSHMEM в основной ветке.
  • Единый интерфейс ElasticBuffer для унификации high-throughput и low-latency режимов.
  • Аналитический расчет количества SM и QP, устраняющий необходимость в авто-тюнинге.

👤 Кому подойдёт: Инженеры по машинному обучению, разработчики фреймворков для распределенного обучения и исследователи, работающие с крупными MoE-моделями на GPU-кластерах.

Релизы