Суть прорыва: от последовательности к параллелизму
Классические autoregressive LLM генерируют токены последовательно, что ограничивает утилизацию GPU и создает узкие места в сценариях с низкой задержкой. NVIDIA и исследователи из UC San Diego представили DFlash (Block Diffusion for Flash Speculative Decoding) — легковесную модель-драфтер, которая генерирует целый блок кандидатов токенов за один проход. Это превращает последовательную черновую работу в параллельную GPU-задачу, которая затем верифицируется целевой моделью.
Решение особенно эффективно на архитектуре NVIDIA Blackwell Ultra, где 160 SM и 640 Tensor Cores 5-го поколения могут задействовать 15 PFLOPS вычислений NVFP4, обрабатывая больше пользователей при той же интерактивности.
Ключевые метрики производительности
Бенчмарки на системе из 8 GPU NVIDIA DGX B300 с моделью gpt-oss-120b показывают беспрецедентный рост пропускной способности. При целевой интерактивности 500-600 токенов/сек на пользователя DFlash обеспечивает рост throughput более чем в 15 раз по сравнению с autoregressive декодированием и на 1.5x выше, чем у SOTA-решения EAGLE-3.
Сравнение с EAGLE-3 и другими моделями
DFlash демонстрирует стабильное превосходство над EAGLE-3 на различных датасетах Speed-Bench. Ниже приведены данные по увеличению интерактивности (speedup) при совпадении уровня пользовательской конкурентности:
| Модель | Датасет | EAGLE-3 Speedup | DFlash Speedup |
|---|---|---|---|
| gpt-oss-120b | Coding | 1.8x | 2.6x |
| gpt-oss-120b | RAG | 1.7x | 2.3x |
| gpt-oss-120b | Reasoning | 1.8x | 2.3x |
| Llama 3.1 8B | Coding | 2.3x | 3.0x |
| Llama 3.1 8B | Multilingual | 1.4x | 2.4x |
Для Gemma 4 31B на одном GPU Blackwell Ultra прирост throughput над autoregressive режимом достигает 5.8x (задача Math500), а для Qwen3 8B в SGLang — 5.1x.
Интеграция без рефакторинга кода
Главное преимущество для разработчиков — бесшовная интеграция в популярные фреймворки: vLLM, SGLang и TensorRT-LLM. В vLLM замена EAGLE-3 на DFlash требует только изменения конфигурации через библиотеку Speculators, без переписывания кода приложения. Исследователи уже опубликовали 20 чекпоинтов DFlash на Hugging Face, поддерживающих архитектуры Blackwell и Hopper для семейств Qwen, Llama, Gemma и gpt-oss.
Источник: NVIDIA dev blog ↗
