Вышла версия v2.1.1.post3.
deepseek-ai/DeepGEMM
DeepGEMM: чистая и эффективная библиотека BLAS-ядер для GPU
Что это за инструмент
DeepGEMM — это легковесная библиотека CUDA-ядер для GPU, оптимизированная под архитектуру NVIDIA (SM90/SM100), объединяющая высокопроизводительные GEMM-операции и специализированные примитивы для LLM.
Зачем нужен
Инструмент решает задачу ускорения вычислений в современных больших языковых моделях, обеспечивая производительность на уровне или выше экспертно-настроенных библиотек. Он полезен тем, кто хочет избежать сложностей с компиляцией CUDA при установке, так как использует JIT-компиляцию, и тем, кому нужны оптимизированные ядра для специфичных операций, таких как MoE и MQA.
Что можно реализовать
- Обучение и инференс LLM с использованием архитектуры MoE (Mega MoE) с перекрытием коммуникации
- Высокоскоростные матричные умножения (GEMM) в форматах FP8, FP4 и BF16 на GPU NVIDIA
- Оптимизация индексаторов для LLM через ядра скоринга (MQA scoring) для lightning indexer
- Вычисление градиентов весов (weight gradient kernels) для dense и MoE моделей на этапе backpropagation
Ключевые возможности
- Поддержка архитектур SM90 (Hopper) и SM100 (Blackwell) с разными требованиями к форматам масштабирования
- JIT-компиляция на лету без необходимости предварительной сборки CUDA, что упрощает установку
- Достигает производительности до 1550 TFLOPS на H800, конкурируя с CUTLASS
- Чистая и простая кодовая база, удобная для изучения техник оптимизации GPU-ядер
- Группировка GEMM по оси M (contiguous layout) и оси K (K-axis-grouped) для эффективной работы с экспертами MoE
👤 Кому подойдёт: Разработчики AI-инфраструктуры, исследователи в области оптимизации GPU, инженеры, работающие с LLM и MoE-архитектурами