deepseek-ai/FlashMLA
FlashMLA: эффективные ядра многозаголовочного латентного внимания
Инференс⭐ 12 951C++
Что это за инструмент
FlashMLA — это библиотека оптимизированных ядер внимания (attention kernels) от DeepSeek, обеспечивающая высокую производительность вычислений для моделей DeepSeek-V3 и V3.2.
Зачем нужен
Инструмент решает задачу ускорения этапов префиллинга (prefill) и декодирования (decoding) в моделях с использованием MLA (Multi-head Latent Attention). Он полезен для снижения задержек и увеличения пропускной способности за счет специализированных ядер, включая поддержку разреженного внимания и кэша KV в формате FP8.
Что можно реализовать
- Развертывание моделей DeepSeek-V3 и DeepSeek-V3.2-Exp с максимальной производительностью
- Оптимизация этапа декодирования с использованием FP8 KV cache для экономии памяти и ускорения вычислений
- Реализация токено-уровневого разреженного внимания (Sparse Attention) для префиллинга и декодирования
- Использование плотного внимания (Dense Attention) на новых архитектурах GPU SM100 (B200)
Ключевые возможности
- Достигает до 660 TFLOPS на NVIDIA H800 SXM5 и 1460 TFLOPS на B200 для плотного префиллинга
- Поддержка токено-уровневого разреженного внимания (DSA) с выделением до 640 TFLOPS на префиллинге
- Оптимизация декодирования: до 3000 GB/s в конфигурации, ограниченной памятью, и 660 TFLOPS в вычислительно ограниченной
- Полная совместимость интерфейсов при обновлении версий с улучшением производительности на 5-15%
- Поддержка архитектур GPU SM90 и SM100 с CUDA 12.8+
👤 Кому подойдёт: Разработчики LLM, инженеры ML-инфраструктуры, исследователи, работающие с оптимизацией inference-пайплайнов и специфическими архитектурами внимания (MLA, Sparse Attention)
Релизы
Релизы ещё не отслежены — появятся после ближайшего опроса.