Главная/Блог/Гайд/vLLM на GPU: выбор железа, VRAM и…
Гайд4 мин чтения · 13 августа 2026 г.

vLLM на GPU: выбор железа, VRAM и установка

Разбираем требования vLLM к видеокартам NVIDIA, AMD и Apple. Сколько VRAM нужно для LLM, как собрать wheel и запустить инференс.

vLLM на GPU: выбор железа, VRAM и установка

vLLM — это высокопроизводительная библиотека для инференса больших языковых моделей (LLM), которая стала стандартом де-факто благодаря поддержке PagedAttention. Однако за скоростью скрываются строгие аппаратные требования. В этой статье разберем, какое железо нужно для запуска vLLM, как правильно установить зависимости и какие подводные камни ждут при выборе GPU.

01Поддерживаемые платформы и ОС

vLLM — это Python-библиотека, которая официально поддерживает только Linux. Версии Python: 3.10 — 3.13. Если вы работаете в Windows, нативная установка невозможна. Единственный рабочий вариант — использовать Windows Subsystem for Linux (WSL) с совместимым дистрибутивом Linux или использовать форки сообщества (например, SystemPanic/vllm-windows), но для продакшена это не рекомендуется.

Библиотека поддерживает четыре основные аппаратные платформы:

  • NVIDIA CUDA: Полная поддержка всех современных GPU.
  • AMD ROCm: Поддержка карт серии Radeon Instinct и потребительских карт (с ограничениями).
  • Intel XPU: Поддержка GPU серии Intel Arc и Data Center.
  • Apple Silicon: Поддержка чипов M1/M2/M3/M4 через Metal Performance Shaders.

02Установка: Wheels и сборка из исходников

Самый простой способ установки — использование готовых pre-built wheels. Однако, если вам нужна специфическая версия CUDA или ROCm, или вы хотите оптимизировать сборку под свое железо, придется собирать wheel из исходников.

Для сборки из исходников требуется наличие компилятора и соответствующих библиотек. Ниже приведена общая логика установки через pip, но конкретные флаги зависят от выбранного бэкенда.

terminalbash
pip install vllm
# Для NVIDIA CUDA (автоматически определяет версию CUDA)
# Для AMD ROCm требуется установка ROCm toolkit перед установкой vllm

При использовании Docker, vLLM предоставляет готовые образы. Это самый надежный способ избежать конфликтов зависимостей. Образы доступны для всех поддерживаемых GPU-бэкендов.

⚠️
Важно. vLLM не поддерживает Windows нативно. Использование WSL возможно, но может привести к проблемам с производительностью и доступом к GPU. Для продакшен-сред всегда используйте Linux.

03Требования к VRAM и модели

Главный ограничитель при выборе GPU — объем видеопамяти (VRAM). vLLM использует PagedAttention, что позволяет эффективно управлять памятью, но базовые требования остаются высокими. Объем VRAM зависит от размера модели (количества параметров) и типа квантования.

Требования к VRAM варьируются в зависимости от выбранной модели и точности вычислений. Как правило, для запуска моделей среднего размера требуются GPU с объемом памяти, достаточным для размещения весов, в то время как для больших моделей необходимо несколько GPU или карты с экстремально большим объемом памяти. Использование квантования позволяет заметно снизить требования к памяти, делая запуск крупных моделей возможным на более доступном оборудовании, хотя и с возможным компромиссом в качестве.

💡
Совет. Если вы выбираете между несколькими GPU меньшего объема и одним большим, часто выгоднее взять несколько карт, чем одну карту с меньшим объемом. vLLM поддерживает multi-GPU инференс, что позволяет масштабировать производительность линейно при наличии достаточного количества памяти.

04Особенности по производителям GPU

NVIDIA CUDA

Самая стабильная и поддерживаемая платформа. Поддерживаются все современные архитектуры. Для установки требуется драйвер NVIDIA и CUDA Toolkit. Версия CUDA должна совпадать с версией, для которой собран wheel.

AMD ROCm

Поддержка AMD растет, но требует более тщательной настройки. Поддерживаются карты серии Radeon Instinct и некоторые потребительские карты. Требуется установка ROCm toolkit. Важно: не все функции vLLM доступны на ROCm, и производительность может уступать NVIDIA на некоторых моделях.

Apple Silicon

vLLM поддерживает чипы M1, M2, M3, M4. Используется Metal Performance Shaders. Поскольку память в Mac унифицирована, VRAM равен общему объему RAM. Например, Mac Studio с большим объемом RAM может запустить очень большие модели. Однако скорость инференса значительно ниже, чем на NVIDIA GPU, особенно для больших батчей.

05Какое железо кому подойдёт

Выбор железа зависит от бюджета и задач:

  • Начинающие / Хобби: Один GPU NVIDIA. Позволяет запускать модели среднего размера в fp16 или большие модели в квантованном виде. Можно купить б/у на вторичном рынке.
  • Продакшен / Малый бизнес: Сервер с несколькими GPU. Обеспечивает высокую пропускную способность для моделей среднего и большого размера. Аренда таких серверов в облаках стоит значительно, но окупается производительностью.
  • Крупные предприятия: Кластеры с высокопроизводительными GPU. Необходимо для моделей с сотнями миллиардов параметров и высокой нагрузкой. Стоимость владения измеряется значительными суммами.
  • Тестирование / Разработка: Mac Studio. Удобно для локальной разработки и тестирования, но не подходит для высоконагруженного продакшена.

В России купить новые высокопроизводительные NVIDIA GPU сложно из-за ограничений на экспорт, поэтому многие компании обращаются к параллельному импорту или используют облачные решения.

Источник: источник (тест/офиц. документация) ↗