Лидер open-source LLM-инференса
vLLM, изначально разработанный в лаборатории Sky Computing Lab при Калифорнийском университете в Беркли, превратился в один из самых активных проектов с участием более 2000 контрибьюторов. Библиотека позиционируется как инструмент для быстрого, простого и дешевого инференса больших языковых моделей (LLM). Ключевое преимущество vLLM — поддержка более 200 архитектур моделей с Hugging Face, включая декодеры (Llama, Qwen, Gemma), MoE-модели (Mixtral, DeepSeek-V3), мультимодальные системы (LLaVA, Qwen-VL) и модели встраивания.
Технологическое ядро: PagedAttention и оптимизация
Основой скорости vLLM является алгоритм PagedAttention, обеспечивающий эффективное управление памятью ключей и значений внимания. В сочетании с непрерывным батчингом запросов, чанковым префиллингом и кэшированием префиксов это позволяет достигать пропускной способности на уровне индустрии. Проект также поддерживает диссоциированный префилл, декодирование и кодирование, а также автоматическую генерацию ядер через torch.compile.
Гибкость квантования и аппаратной поддержки
vLLM предлагает широчайший спектр форматов квантования для оптимизации ресурсов: FP8, MXFP8/MXFP4, NVFP4, INT8, INT4, GPTQ/AWQ, GGUF, compressed-tensors, ModelOpt и TorchAO. Аппаратная совместимость выходит за рамки NVIDIA, поддерживая AMD, Intel, Google TPU, Intel Gaudi, IBM Spyre, Huawei Ascend, Apple Silicon и другие.
Сравнение ключевых возможностей vLLM
| Категория | Ключевые технологии и функции |
|---|---|
| Архитектуры | Decoder-only, MoE, Hybrid (Mamba), Multi-modal, Embedding, Reward |
| Квантование | FP8, MXFP8, NVFP4, INT8, INT4, GPTQ, AWQ, GGUF, TorchAO |
| Ядра внимания | FlashAttention, FlashInfer, TRTLLM-GEN, FlashMLA, Triton |
| Speculative Decoding | n-gram, suffix, EAGLE, DFlash |
| API и интеграции | OpenAI-compatible, Anthropic Messages, gRPC, Hugging Face |
Быстрый старт и экосистема
Установка vLLM максимально упрощена: рекомендуется использовать менеджер пакетов uv (uv pip install vllm) или классический pip. Для разработчиков доступна сборка из исходного кода. Проект активно развивает документацию, форум пользователей и Slack-канал для координации вкладов. Если вы используете vLLM в исследованиях, рекомендуется ссылаться на статью Woosuk Kwon и соавторов, опубликованную в SIGOPS 2023.
Источник: Github ↗
