Запуск больших языковых моделей (LLM) требует не только мощного процессора, но и правильного выбора графического ускорителя. Библиотека vLLM, ставшая стандартом для эффективного инференса, строго привязана к аппаратному обеспечению. В этой статье разберем, какие GPU поддерживаются, сколько видеопамяти нужно для разных моделей и как правильно настроить окружение в Linux.
01Поддерживаемые платформы и архитектура
vLLM — это Python-библиотека, которая работает преимущественно в среде Linux. Поддержка Windows нативно отсутствует, хотя существуют обходные пути через WSL (Windows Subsystem for Linux) или форки сообщества. Для работы требуется Python версий 3.10–3.13.
Основные направления поддержки GPU в vLLM:
- NVIDIA CUDA: Полная поддержка всех современных карт серии RTX и Data Center (A100, H100, L40S).
- AMD ROCm: Поддержка карт серии Radeon Pro и Instinct. Требует специфических версий драйверов и ядра Linux.
- Intel XPU: Поддержка графических процессоров Intel Arc и Data Center GPU Max.
- Apple Silicon: Поддержка чипов M1/M2/M3/M4. Использует Unified Memory, что упрощает работу с большими моделями, но ограничивает пиковую пропускную способность.
02Требования к VRAM и выбор модели
Главный ограничитель при выборе железа — объем видеопамяти (VRAM). vLLM использует технологию PagedAttention, которая эффективно управляет памятью, но базовые требования остаются жесткими. Ниже приведена ориентировочная таблица потребностей VRAM для популярных архитектур моделей (в 4-битном квантованном формате, например, через AWQ или GPTQ, для экономии ресурсов):
| Модель (параметры) | Тип квантования | Мин. VRAM (GPU) | Рекомендуемая VRAM |
|---|---|---|---|
| Малые модели (до 13B) | INT4 (GPTQ/AWQ) | Минимальный объем | Компьютерные карты начального уровня |
| Средние модели (до 70B) | INT4 | Значительный объем | Мощные игровые или профессиональные карты |
| Крупные модели (Mixtral) | INT4 | Высокий объем | Многослойные конфигурации |
| Очень крупные модели (405B+) | INT4 | Критический объем | Кластеры серверных ускорителей (A100/H100) |
Для Apple Silicon (M1/M2/M3 Max/Ultra) объем Unified Memory выступает в роли VRAM. Например, MacBook Pro с большим объемом памяти потянет крупные модели в квантованном виде, но скорость генерации будет заметно ниже, чем на NVIDIA A100 из-за пропускной способности памяти.
03Установка и сборка окружения
vLLM требует сборки из исходного кода или установки готовых wheel-пакетов, совместимых с вашей версией CUDA/ROCm. Простая pip install vllm часто не работает из-за необходимости компиляции кастомных CUDA-ядер.
Установка для NVIDIA CUDA
Убедитесь, что у вас установлен драйвер NVIDIA и toolkit CUDA, совместимый с версией PyTorch. Стандартный способ установки через pre-built wheels:
pip install vllm
# Или для конкретной версии CUDA (пример для CUDA 12.1):
pip install vllm --extra-index-url https://download.pytorch.org/whl/cu121Если вы хотите собрать пакет из исходного кода (для получения последних оптимизаций):
git clone https://github.com/vllm-project/vllm.git
cd vllm
pip install -r requirements-build.txt
pip install -e .Установка для AMD ROCm
Для карт AMD требуется установка ROCm toolkit. Процесс аналогичен, но с указанием индекса пакетов для ROCm:
pip install vllm --extra-index-url https://download.pytorch.org/whl/rocm6.0Apple Silicon (M1/M2/M3)
На Mac установка максимально проста, так как не требует компиляции CUDA-ядер:
pip install vllm04Какое железо кому подойдёт
Выбор платформы зависит от бюджета и задач:
- Бюджетный сегмент: NVIDIA RTX 3060 или RTX 4060 Ti. Подойдет для локального запуска моделей малого размера. Apple M2/M3 Mini/Pro с небольшим объемом памяти — альтернатива для тихой работы, но медленнее.
- Продвинутый уровень: NVIDIA RTX 4090. Лучшая карта для энтузиастов. Позволяет запускать модели среднего размера в полном精度 или крупные модели в квантованном виде (с ограничениями по контексту). Также можно рассмотреть б/у RTX 3090 для экономии.
- Серверный уровень: NVIDIA A100 или H100. Необходимы для production-инференса, больших моделей и высокой нагрузки. В РФ эти карты доступны через параллельный импорт, цены значительно выше потребительских аналогов.
Источник: Официальная документация ↗
