vLLM v0.29.0: Model Runner V2 по умолчанию, поддержка новых моделей (Hy4, Qwen3.8, Kimi K3) и оптимизации для DeepSeek V4.
- Added: Model Runner V2 стал основным для всех моделей, добавлена профилировка памяти CUDA graph и оптимизации для MTP/EAGLE.
- Added: Добавлена поддержка моделей Hy4-preview, Qwen3.8-Flash-Next, GraniteSWA, NemotronH и Kimi K3 (NVFP4).
- Added: Значительные ускорения для Kimi K3 и DeepSeek V4: fused MXFP4, оптимизации GEMM, MLA и MoE-бэкенды.
- Added: Улучшено speculative decoding: метрики на уровне запросов, поддержка SM100/SM90 и новых методов (DSpark, DFlash2).
- Breaking: Удалены 10 устаревших архитектур, PyAV, старые флаги; FlexOlmo/Olmo3/Hunyuan переведены на бэкенд Transformers.