Главная/Блог/Гайд/vLLM на GPU: выбор железа, VRAM и…
Гайд4 мин чтения · 3 июля 2026 г.

vLLM на GPU: выбор железа, VRAM и установка

Разбираем требования vLLM к видеокартам: NVIDIA, AMD, Apple. Сколько VRAM нужно для LLM, как собрать и запустить инференс на Linux.

vLLM на GPU: выбор железа, VRAM и установка

Запуск больших языковых моделей (LLM) требует не только мощного процессора, но и правильного выбора графического ускорителя. Библиотека vLLM, ставшая стандартом для эффективного инференса, строго привязана к аппаратному обеспечению. В этой статье разберем, какие GPU поддерживаются, сколько видеопамяти нужно для разных моделей и как правильно настроить окружение в Linux.

01Поддерживаемые платформы и архитектура

vLLM — это Python-библиотека, которая работает преимущественно в среде Linux. Поддержка Windows нативно отсутствует, хотя существуют обходные пути через WSL (Windows Subsystem for Linux) или форки сообщества. Для работы требуется Python версий 3.10–3.13.

Основные направления поддержки GPU в vLLM:

  • NVIDIA CUDA: Полная поддержка всех современных карт серии RTX и Data Center (A100, H100, L40S).
  • AMD ROCm: Поддержка карт серии Radeon Pro и Instinct. Требует специфических версий драйверов и ядра Linux.
  • Intel XPU: Поддержка графических процессоров Intel Arc и Data Center GPU Max.
  • Apple Silicon: Поддержка чипов M1/M2/M3/M4. Использует Unified Memory, что упрощает работу с большими моделями, но ограничивает пиковую пропускную способность.
⚠️
Важно. vLLM не поддерживает Windows нативно. Если вы работаете в Windows, обязательно используйте WSL2 с установленным Linux-дистрибутивом или готовьте окружение через Docker, иначе установка завершится ошибкой.

02Требования к VRAM и выбор модели

Главный ограничитель при выборе железа — объем видеопамяти (VRAM). vLLM использует технологию PagedAttention, которая эффективно управляет памятью, но базовые требования остаются жесткими. Ниже приведена ориентировочная таблица потребностей VRAM для популярных архитектур моделей (в 4-битном квантованном формате, например, через AWQ или GPTQ, для экономии ресурсов):

Модель (параметры) Тип квантования Мин. VRAM (GPU) Рекомендуемая VRAM
Малые модели (до 13B) INT4 (GPTQ/AWQ) Минимальный объем Компьютерные карты начального уровня
Средние модели (до 70B) INT4 Значительный объем Мощные игровые или профессиональные карты
Крупные модели (Mixtral) INT4 Высокий объем Многослойные конфигурации
Очень крупные модели (405B+) INT4 Критический объем Кластеры серверных ускорителей (A100/H100)

Для Apple Silicon (M1/M2/M3 Max/Ultra) объем Unified Memory выступает в роли VRAM. Например, MacBook Pro с большим объемом памяти потянет крупные модели в квантованном виде, но скорость генерации будет заметно ниже, чем на NVIDIA A100 из-за пропускной способности памяти.

💡
Совет. Для домашнего использования или стартапа оптимальным выбором является NVIDIA RTX 4090. Она предлагает лучшее соотношение цена/производительность для моделей среднего размера. Для моделей 70B+ потребуется либо серверная карта, либо связка из нескольких потребительских карт.

03Установка и сборка окружения

vLLM требует сборки из исходного кода или установки готовых wheel-пакетов, совместимых с вашей версией CUDA/ROCm. Простая pip install vllm часто не работает из-за необходимости компиляции кастомных CUDA-ядер.

Установка для NVIDIA CUDA

Убедитесь, что у вас установлен драйвер NVIDIA и toolkit CUDA, совместимый с версией PyTorch. Стандартный способ установки через pre-built wheels:

terminalbash
pip install vllm
# Или для конкретной версии CUDA (пример для CUDA 12.1):
pip install vllm --extra-index-url https://download.pytorch.org/whl/cu121

Если вы хотите собрать пакет из исходного кода (для получения последних оптимизаций):

terminalbash
git clone https://github.com/vllm-project/vllm.git
cd vllm
pip install -r requirements-build.txt
pip install -e .

Установка для AMD ROCm

Для карт AMD требуется установка ROCm toolkit. Процесс аналогичен, но с указанием индекса пакетов для ROCm:

terminalbash
pip install vllm --extra-index-url https://download.pytorch.org/whl/rocm6.0

Apple Silicon (M1/M2/M3)

На Mac установка максимально проста, так как не требует компиляции CUDA-ядер:

terminalbash
pip install vllm
⚠️
Важно. При сборке из исходного кода убедитесь, что версия CUDA в вашей системе совпадает с версией, указанной в требованиях PyTorch. Несоответствие версий (например, CUDA 11.8 против 12.1) приведет к ошибкам линковки на этапе компиляции.

04Какое железо кому подойдёт

Выбор платформы зависит от бюджета и задач:

  • Бюджетный сегмент: NVIDIA RTX 3060 или RTX 4060 Ti. Подойдет для локального запуска моделей малого размера. Apple M2/M3 Mini/Pro с небольшим объемом памяти — альтернатива для тихой работы, но медленнее.
  • Продвинутый уровень: NVIDIA RTX 4090. Лучшая карта для энтузиастов. Позволяет запускать модели среднего размера в полном精度 или крупные модели в квантованном виде (с ограничениями по контексту). Также можно рассмотреть б/у RTX 3090 для экономии.
  • Серверный уровень: NVIDIA A100 или H100. Необходимы для production-инференса, больших моделей и высокой нагрузки. В РФ эти карты доступны через параллельный импорт, цены значительно выше потребительских аналогов.

Источник: Официальная документация ↗