deepseek-ai/DeepGEMM

DeepGEMM: чистая и эффективная библиотека BLAS-ядер для GPU

Инструменты⭐ 7 854Cudaпоследний релиз: v2.1.1.post3
Открыть на GitHub ↗

Что это за инструмент

DeepGEMM — это легковесная библиотека CUDA-ядер для GPU, оптимизированная под архитектуру NVIDIA (SM90/SM100), объединяющая высокопроизводительные GEMM-операции и специализированные примитивы для LLM.

Зачем нужен

Инструмент решает задачу ускорения вычислений в современных больших языковых моделях, обеспечивая производительность на уровне или выше экспертно-настроенных библиотек. Он полезен тем, кто хочет избежать сложностей с компиляцией CUDA при установке, так как использует JIT-компиляцию, и тем, кому нужны оптимизированные ядра для специфичных операций, таких как MoE и MQA.

Что можно реализовать

  • Обучение и инференс LLM с использованием архитектуры MoE (Mega MoE) с перекрытием коммуникации
  • Высокоскоростные матричные умножения (GEMM) в форматах FP8, FP4 и BF16 на GPU NVIDIA
  • Оптимизация индексаторов для LLM через ядра скоринга (MQA scoring) для lightning indexer
  • Вычисление градиентов весов (weight gradient kernels) для dense и MoE моделей на этапе backpropagation

Ключевые возможности

  • Поддержка архитектур SM90 (Hopper) и SM100 (Blackwell) с разными требованиями к форматам масштабирования
  • JIT-компиляция на лету без необходимости предварительной сборки CUDA, что упрощает установку
  • Достигает производительности до 1550 TFLOPS на H800, конкурируя с CUTLASS
  • Чистая и простая кодовая база, удобная для изучения техник оптимизации GPU-ядер
  • Группировка GEMM по оси M (contiguous layout) и оси K (K-axis-grouped) для эффективной работы с экспертами MoE

👤 Кому подойдёт: Разработчики AI-инфраструктуры, исследователи в области оптимизации GPU, инженеры, работающие с LLM и MoE-архитектурами

Релизы