Инструменты15 сентября 2026 г., 21:47 МСК🤖 Auto

vLLM: 200+ моделей, PagedAttention и квантование для быстрого LLM-сервинга

vLLM от UC Berkeley стал стандартом для быстрого и дешевого развертывания LLM. Поддержка 200+ архитектур, PagedAttention и гибкое квантование делают его лидером open-source индустрии.

Баннер новости 7567

Лидер open-source LLM-инференса

vLLM, изначально разработанный в лаборатории Sky Computing Lab при Калифорнийском университете в Беркли, превратился в один из самых активных проектов с участием более 2000 контрибьюторов. Библиотека позиционируется как инструмент для быстрого, простого и дешевого инференса больших языковых моделей (LLM). Ключевое преимущество vLLM — поддержка более 200 архитектур моделей с Hugging Face, включая декодеры (Llama, Qwen, Gemma), MoE-модели (Mixtral, DeepSeek-V3), мультимодальные системы (LLaVA, Qwen-VL) и модели встраивания.

Технологическое ядро: PagedAttention и оптимизация

Основой скорости vLLM является алгоритм PagedAttention, обеспечивающий эффективное управление памятью ключей и значений внимания. В сочетании с непрерывным батчингом запросов, чанковым префиллингом и кэшированием префиксов это позволяет достигать пропускной способности на уровне индустрии. Проект также поддерживает диссоциированный префилл, декодирование и кодирование, а также автоматическую генерацию ядер через torch.compile.

Гибкость квантования и аппаратной поддержки

vLLM предлагает широчайший спектр форматов квантования для оптимизации ресурсов: FP8, MXFP8/MXFP4, NVFP4, INT8, INT4, GPTQ/AWQ, GGUF, compressed-tensors, ModelOpt и TorchAO. Аппаратная совместимость выходит за рамки NVIDIA, поддерживая AMD, Intel, Google TPU, Intel Gaudi, IBM Spyre, Huawei Ascend, Apple Silicon и другие.

Сравнение ключевых возможностей vLLM

Категория Ключевые технологии и функции
Архитектуры Decoder-only, MoE, Hybrid (Mamba), Multi-modal, Embedding, Reward
Квантование FP8, MXFP8, NVFP4, INT8, INT4, GPTQ, AWQ, GGUF, TorchAO
Ядра внимания FlashAttention, FlashInfer, TRTLLM-GEN, FlashMLA, Triton
Speculative Decoding n-gram, suffix, EAGLE, DFlash
API и интеграции OpenAI-compatible, Anthropic Messages, gRPC, Hugging Face

Быстрый старт и экосистема

Установка vLLM максимально упрощена: рекомендуется использовать менеджер пакетов uv (uv pip install vllm) или классический pip. Для разработчиков доступна сборка из исходного кода. Проект активно развивает документацию, форум пользователей и Slack-канал для координации вкладов. Если вы используете vLLM в исследованиях, рекомендуется ссылаться на статью Woosuk Kwon и соавторов, опубликованную в SIGOPS 2023.

Источник: Github ↗