Релиз модели1 июля 2026 г., 00:04 МСК🤖 Auto

NVIDIA DFlash: ускорение Blackwell до 15x через блочное диффузионное декодирование

NVIDIA представила DFlash — open-source модель для спекулятивного декодирования, которая ускоряет инференс LLM на GPU Blackwell до 15x за счет параллельной генерации блоков токенов.

Баннер новости 2625

Суть прорыва: от последовательности к параллелизму

Классические autoregressive LLM генерируют токены последовательно, что ограничивает утилизацию GPU и создает узкие места в сценариях с низкой задержкой. NVIDIA и исследователи из UC San Diego представили DFlash (Block Diffusion for Flash Speculative Decoding) — легковесную модель-драфтер, которая генерирует целый блок кандидатов токенов за один проход. Это превращает последовательную черновую работу в параллельную GPU-задачу, которая затем верифицируется целевой моделью.

Решение особенно эффективно на архитектуре NVIDIA Blackwell Ultra, где 160 SM и 640 Tensor Cores 5-го поколения могут задействовать 15 PFLOPS вычислений NVFP4, обрабатывая больше пользователей при той же интерактивности.

Ключевые метрики производительности

Бенчмарки на системе из 8 GPU NVIDIA DGX B300 с моделью gpt-oss-120b показывают беспрецедентный рост пропускной способности. При целевой интерактивности 500-600 токенов/сек на пользователя DFlash обеспечивает рост throughput более чем в 15 раз по сравнению с autoregressive декодированием и на 1.5x выше, чем у SOTA-решения EAGLE-3.

Сравнение с EAGLE-3 и другими моделями

DFlash демонстрирует стабильное превосходство над EAGLE-3 на различных датасетах Speed-Bench. Ниже приведены данные по увеличению интерактивности (speedup) при совпадении уровня пользовательской конкурентности:

Модель Датасет EAGLE-3 Speedup DFlash Speedup
gpt-oss-120b Coding 1.8x 2.6x
gpt-oss-120b RAG 1.7x 2.3x
gpt-oss-120b Reasoning 1.8x 2.3x
Llama 3.1 8B Coding 2.3x 3.0x
Llama 3.1 8B Multilingual 1.4x 2.4x

Для Gemma 4 31B на одном GPU Blackwell Ultra прирост throughput над autoregressive режимом достигает 5.8x (задача Math500), а для Qwen3 8B в SGLang — 5.1x.

Интеграция без рефакторинга кода

Главное преимущество для разработчиков — бесшовная интеграция в популярные фреймворки: vLLM, SGLang и TensorRT-LLM. В vLLM замена EAGLE-3 на DFlash требует только изменения конфигурации через библиотеку Speculators, без переписывания кода приложения. Исследователи уже опубликовали 20 чекпоинтов DFlash на Hugging Face, поддерживающих архитектуры Blackwell и Hopper для семейств Qwen, Llama, Gemma и gpt-oss.

Источник: NVIDIA dev blog ↗