deepseek-ai/FlashMLA

FlashMLA: эффективные ядра многозаголовочного латентного внимания

Инференс⭐ 12 951C++
Открыть на GitHub ↗

Что это за инструмент

FlashMLA — это библиотека оптимизированных ядер внимания (attention kernels) от DeepSeek, обеспечивающая высокую производительность вычислений для моделей DeepSeek-V3 и V3.2.

Зачем нужен

Инструмент решает задачу ускорения этапов префиллинга (prefill) и декодирования (decoding) в моделях с использованием MLA (Multi-head Latent Attention). Он полезен для снижения задержек и увеличения пропускной способности за счет специализированных ядер, включая поддержку разреженного внимания и кэша KV в формате FP8.

Что можно реализовать

  • Развертывание моделей DeepSeek-V3 и DeepSeek-V3.2-Exp с максимальной производительностью
  • Оптимизация этапа декодирования с использованием FP8 KV cache для экономии памяти и ускорения вычислений
  • Реализация токено-уровневого разреженного внимания (Sparse Attention) для префиллинга и декодирования
  • Использование плотного внимания (Dense Attention) на новых архитектурах GPU SM100 (B200)

Ключевые возможности

  • Достигает до 660 TFLOPS на NVIDIA H800 SXM5 и 1460 TFLOPS на B200 для плотного префиллинга
  • Поддержка токено-уровневого разреженного внимания (DSA) с выделением до 640 TFLOPS на префиллинге
  • Оптимизация декодирования: до 3000 GB/s в конфигурации, ограниченной памятью, и 660 TFLOPS в вычислительно ограниченной
  • Полная совместимость интерфейсов при обновлении версий с улучшением производительности на 5-15%
  • Поддержка архитектур GPU SM90 и SM100 с CUDA 12.8+

👤 Кому подойдёт: Разработчики LLM, инженеры ML-инфраструктуры, исследователи, работающие с оптимизацией inference-пайплайнов и специфическими архитектурами внимания (MLA, Sparse Attention)

Релизы

Релизы ещё не отслежены — появятся после ближайшего опроса.