vllm-project/vllm

Высокоскоростной и эффективный по памяти движок для инференса и обслуживания LLM

Инференс⭐ 92 278Pythonпоследний релиз: v0.29.0
Открыть на GitHub ↗Сайт проекта ↗

Что это за инструмент

vLLM — это высокопроизводительный и эффективный по памяти движок для инференса и обслуживания больших языковых моделей (LLM). Он позволяет развертывать LLM с максимальной пропускной способностью и минимальными затратами ресурсов.

Зачем нужен

Инструмент решает задачу быстрого и дешевого запуска LLM в продакшене, обеспечивая высокую пропускную способность за счет технологий PagedAttention и непрерывного батчинга запросов. Он полезен для оптимизации использования GPU, поддержки множества форматов квантования и интеграции с популярными моделями из Hugging Face без сложной настройки.

Что можно реализовать

  • Развертывание OpenAI-совместимого API сервера для LLM
  • Обслуживание мультимодальных моделей (например, LLaVA, Qwen-VL) и MoE-архитектур
  • Генерация структурированных выходов с использованием xgrammar или guidance
  • Использование специкулятивного декодирования (speculative decoding) для ускорения генерации
  • Поддержка LoRA-адаптеров для плотных и MoE слоев

Ключевые возможности

  • PagedAttention для эффективного управления памятью ключей и значений
  • Непрерывный батчинг запросов (continuous batching) и кэширование префиксов
  • Поддержка широкого спектра квантований: FP8, INT8, INT4, GPTQ, AWQ, GGUF и других
  • Оптимизированные ядра внимания (FlashAttention, FlashInfer) и GEMM/MoE
  • Автоматическая генерация ядер и графовые трансформации через torch.compile

👤 Кому подойдёт: Разработчики ML-инфраструктуры, инженеры по машинному обучению, исследователи и компании, развертывающие LLM в продакшене

Релизы

v0.29.0majorbreaking
🕐 12 дн назад · релиз на GitHub ↗

vLLM v0.29.0: Model Runner V2 по умолчанию, поддержка новых моделей (Hy4, Qwen3.8, Kimi K3) и оптимизации для DeepSeek V4.

  • Added: Model Runner V2 стал основным для всех моделей, добавлена профилировка памяти CUDA graph и оптимизации для MTP/EAGLE.
  • Added: Добавлена поддержка моделей Hy4-preview, Qwen3.8-Flash-Next, GraniteSWA, NemotronH и Kimi K3 (NVFP4).
  • Added: Значительные ускорения для Kimi K3 и DeepSeek V4: fused MXFP4, оптимизации GEMM, MLA и MoE-бэкенды.
  • Added: Улучшено speculative decoding: метрики на уровне запросов, поддержка SM100/SM90 и новых методов (DSpark, DFlash2).
  • Breaking: Удалены 10 устаревших архитектур, PyAV, старые флаги; FlexOlmo/Olmo3/Hunyuan переведены на бэкенд Transformers.
v0.28.0majorbreaking
🕐 26 дн назад · релиз на GitHub ↗

Релиз v0.28.0: оптимизация Kimi-K3 и DeepSeek V4, поддержка MLA, новый Model Runner V2 и отключение bitsandbytes.

  • Breaking: Поддержка bitsandbytes перенесена во внедревный плагин, удалены calculate_kv_scales и override_attention_dtype, обновлены зависимости.
  • Added: Масштабная оптимизация Kimi-K3: добавлена DCP, fused kernels, поддержка ROCm и экономия памяти через shared-expert sharding.
  • Added: DeepSeek V4: полная поддержка sparse MLA для decode, MTP и DSpark, добавлена поддержка AMD Quark NVFP4.
  • Added: Model Runner V2: реализована E/P/D дисагрегация, weight offloading, поддержка encoder CUDA graphs и attention-free моделей.
  • Added: Tiered KV cache offloading: добавлена выгрузка на диск, метрики и кэширование префиксов для Mamba по умолчанию.
v0.27.1patch
🕐 1 мес назад · релиз на GitHub ↗

Выпущен патч v0.27.1 для vLLM, добавляющий поддержку квантованных заголовков DSpark Markov.

  • Added: Добавлена поддержка квантованных заголовков DSpark Markov.
v0.27.0majorbreaking
🕐 1 мес назад · релиз на GitHub ↗

vLLM 0.27.0: поддержка Kimi K3, Qwen3.5, PyTorch 2.13.0 (breaking), FlashAttention 4 и оптимизации DeepSeek-V4.

  • Breaking: Обновление до PyTorch 2.13.0, torchvision 0.28.0 и Triton 3.7.1; XPU и CPU также перешли на torch 2.13.
  • Added: Полная поддержка Kimi K3: ядро, ядра AttnRes, DeepGEMM, фронтенды Python/Rust, DSpark AR fusion и шардирование общих экспертов.
  • Added: Добавлена поддержка моделей Qwen3.5 (dense/MoE), K-EXAONE-2.0-750B-A37B, VaultGemma и jina-embeddings-v5-text-nano.
  • Added: Углублена интеграция FlashAttention 4 на SM100: поддержка FP8 KV cache, headdim-256 и инфраструктура JIT-разогрева.
  • Added: Масштабные оптимизации DeepSeek-V4: sequence parallelism, ускорение ядер, экономия памяти и снижение TTFT.
v0.26.0major
🕐 1 мес назад · релиз на GitHub ↗

v0.26.0: поддержка Inkling, оптимизация DeepSeek-V4, fp32 lm_head, гибкие бэкенды внимания и KV-offloading.

  • Added: Полная поддержка модели Inkling: базовое моделирование, CUDA-графики, MTP=1, LoRA и квантование NVFP4.
  • Added: Значительный прирост производительности DeepSeek-V4 за счёт специализированных ядер маршрутизации и оптимизаций декодирования.
  • Added: Внедрение fp32 lm_head для моделей генерации через head_dtype, улучшающее точность заголовков.
  • Added: Гибкие бэкенды внимания: выбор бэкенда для каждой группы KV-cache и явная поддержка sliding-window.
  • Added: Зрелый KV-offloading: метрики, иерархическое хранилище, объектные хранилища и поддержка CPU-кэша.
v0.24.0majorbreaking
🕐 2 мес назад · релиз на GitHub ↗

vLLM v0.24.0: поддержка MiniMax-M3, DeepSeek-V4, MRv2 по умолчанию, Rust-фронтенд и отказ от CUDA_VISIBLE_DEVICES.

  • Breaking: Убрано внутреннее управление CUDA_VISIBLE_DEVICES; теперь используется аргумент device_ids.
  • Added: Добавлена поддержка моделей MiniMax-M3, DiffusionGemma, Hierarchical Reasoning Model и OpenMOSS.
  • Added: Model Runner V2 теперь поддерживает квантованные модели и GraniteMoE по умолчанию.
  • Added: Расширены возможности Rust-фронтенда: добавлена аутентификация, CORS и новые API-эндпоинты.
  • Added: Глубокая оптимизация DeepSeek-V4: улучшен TTFT, пропускная способность и добавлена поддержка SM120.