Главная/Блог/Гайд/vLLM на GPU: выбор железа, VRAM и…
Гайд4 мин чтения · 22 сентября 2026 г.

vLLM на GPU: выбор железа, VRAM и установка

Разбираем требования vLLM к видеокартам NVIDIA, AMD и Apple. Сколько VRAM нужно для LLM, как собрать из исходников и что выбрать в РФ.

vLLM на GPU: выбор железа, VRAM и установка

vLLM — это высокопроизводительная библиотека для инференса больших языковых моделей (LLM), которая активно используется в продакшене. Однако её установка и работа напрямую зависят от аппаратного обеспечения. В отличие от некоторых универсальных фреймворков, vLLM требует строгого соответствия версии CUDA/ROCm и архитектуры GPU. Разберём, какое железо нужно для разных сценариев, как избежать ошибок при сборке и какие варианты доступны российскому пользователю.

01Поддерживаемые платформы и архитектура

vLLM официально поддерживает несколько основных аппаратных платформ. Выбор зависит от доступности оборудования и ваших задач:

  • NVIDIA CUDA: Золотой стандарт. Поддерживает широкий спектр карт от потребительских до профессиональных. Требует Linux (или WSL2) и Python 3.10–3.13.
  • AMD ROCm: Альтернатива для карт серии Radeon Pro и Instinct. Поддержка растёт, но требует более специфичных версий Linux-ядра и драйверов.
  • Intel XPU: Поддержка карт серии Arc и Data Center GPU Max. На данный момент функционал может быть ограниченным по сравнению с CUDA.
  • Apple Silicon: Чипы M1/M2/M3/M4. Используют общую память (Unified Memory), что упрощает работу с большими моделями, но скорость инференса часто уступает NVIDIA.
⚠️
Важно. vLLM не поддерживает Windows нативно. Если вы работаете в Windows, вам необходимо использовать Windows Subsystem for Linux (WSL) с совместимым дистрибутивом Linux или использовать неофициальные форки, такие как SystemPanic/vllm-windows. Для продакшена это не рекомендуется.

02Требования к VRAM и модели

Главный ограничитель при запуске LLM — объём видеопамяти (VRAM). vLLM использует технологию PagedAttention, которая эффективно управляет памятью, но базовые требования остаются:

  • Малые модели: Достаточно базового объёма VRAM (например, для карт начального и среднего уровня). Для комфортной работы с контекстом лучше иметь запас памяти.
  • Средние модели: Требуется значительный объём VRAM. Здесь вступают в игру карты с большим объёмом памяти для квантованных моделей или профессиональные решения.
  • Крупные модели: Необходима мульти-GPU конфигурация или серверные решения.

Для Apple Silicon правило простое: модель + контекст должны помещаться в общую память. MacBook Pro с большим объёмом RAM позволяет запускать довольно крупные модели, но скорость генерации токенов будет ниже, чем на NVIDIA.

💡
Совет. Если вы выбираете между несколькими картами NVIDIA, приоритет отдавайте объёму VRAM, а не только вычислительной мощности. Карты с большим объёмом памяти часто выгоднее, так как позволяют запускать более качественные модели без квантования.

03Установка: Python и Docker

Самый простой способ — использовать готовые wheel-пакеты. Однако, если вам нужна последняя версия или специфичная архитектура, придётся собирать пакет из исходников. Ниже приведены примеры команд для NVIDIA CUDA.

Сборка из исходников (NVIDIA CUDA)

Для сборки потребуется установленный CUDA Toolkit, соответствующий версии драйвера. Команды ниже актуальны для базовой установки:

terminalbash
pip install vllm

Если вы собираете из исходников, убедитесь, что переменная окружения CUDA_HOME указывает на правильную версию CUDA. Для AMD ROCm процесс аналогичен, но требует установки ROCm Toolkit и настройки переменных окружения ROCM_PATH.

Docker-контейнеры

vLLM предоставляет готовые образы Docker, что избавляет от проблем с зависимостями. Для NVIDIA:

terminalbash
docker run --gpus all -it --rm vllm/vllm-openai:latest

Для AMD ROCm:

terminalbash
docker run --device /dev/kfd --device /dev/dri -it --rm vllm/vllm-openai:rocm
⚠️
Важно. При использовании Docker на AMD ROCm обязательно монтируйте устройства /dev/kfd и /dev/dri. Без этого контейнер не увидит GPU. Также убедитесь, что версия ROCm в хост-системе совпадает с версией в образе.

04Реальность рынка в РФ: что купить или арендовать?

В условиях санкций прямые поставки высокопроизводительных GPU (NVIDIA H100, A100) в РФ затруднены. Однако есть рабочие схемы:

  1. Аренда GPU в облаке: Российские облачные провайдеры и специализированные AI-платформы предлагают аренду GPU. Это самый быстрый способ запустить vLLM без покупки железа. Цена варьируется в зависимости от модели.
  2. Параллельный импорт: Потребительские и профессиональные карты можно купить у серых импортеров. Карты с большим объёмом памяти остаются популярным выбором для локального запуска моделей в квантованном виде.
  3. Apple Mac Studio: Mac Studio M2 Max/Ultra — отличная альтернатива для тех, кто хочет локальный инференс без драйверов CUDA. Unified Memory позволяет загружать модели, которые не влезают в VRAM обычных карт. Большой объём RAM позволяет запускать довольно крупные модели.

05Какое железо кому подойдёт

Выбор зависит от бюджета и задач:

  • Энтузиасты / Стартапы: Карты с большим объёмом памяти. Идеально для малых и средних моделей, квантованных версий. Можно использовать одну карту или связку двух через NVLink (если поддерживается).
  • Бизнес / Средний продакшен: Аренда мощных GPU в облаке или покупка профессиональных решений. Эти карты позволяют запускать более сложные задачи.

Источник: источник (тест/офиц. документация) ↗