Главная/Блог/Гайд/SGLang на GPU: железо, установка и…
Гайд4 мин чтения · 16 августа 2026 г.

SGLang на GPU: железо, установка и производительность

Разбираем, какое железо нужно для SGLang, как установить рантайм и где искать производительность в РФ.

SGLang (Serving LLMs with Graph) — это высокопроизводительный рантайм для инференса больших языковых моделей. В отличие от классических подходов, он использует RadixAttention для кэширования префиксов и Zero-Overhead CPU Scheduler, что позволяет достигать рекордных скоростей генерации. Ниже — практическое руководство по выбору железа, установке и оптимизации, основанное на реальных данных проекта.

01Поддерживаемое железо и VRAM

SGLang отличается широкой поддержкой аппаратных платформ. Проект официально поддерживает NVIDIA GPU (от старых A100 до новейших GB200/B300), AMD Instinct (MI300/MI300X), Intel Xeon CPU, Google TPU и Ascend NPU. Это делает его отличным выбором для гибридных инфраструктур.

Требования к VRAM зависят от модели и используемой квантования. SGLang поддерживает FP4, FP8, INT4, AWQ и GPTQ. Для моделей уровня DeepSeek-V3/R1 или Llama-3-70B в полном精度 (FP16) потребуется кластер из нескольких GPU (например, 8x H100 или 8x A100). Для локального запуска моделей до 7-8B параметров достаточно одной современной видеокарты с 8-12 ГБ VRAM (RTX 3090/4090). Для моделей 13-34B потребуется 24-48 ГБ VRAM (RTX 4090/3090 или A6000).

⚠️
Важно. При использовании AMD Instinct MI300X убедитесь, что вы используете последние версии ROCm и AITER, так как оптимизации для DeepSeek и других моделей часто выходят первыми именно для этой платформы. Совместимость с NVIDIA более стабильна «из коробки».

02Установка и запуск

Установка SGLang проста, но требует внимательности к версиям Python и CUDA/ROCm. Ниже приведена стандартная команда для установки через pip:

terminalbash
pip install sglang[all] --find-links https://flashinfer.ai/whl/cu121/torch2.4/

Для запуска сервера инференса используется команда:

terminalbash
python -m sglang.launch_server --model-path lmsys/vicuna-7b-v1.5 --host 0.0.0.0 --port 30000

Ключевые флаги:

  • --model-path: путь к модели в Hugging Face или локальный путь.
  • --tensor-parallel-size: количество GPU для параллельного запуска (например, 4 для 4x A100).
  • --quantization: флаг для включения квантования (fp8, int4, awq), что критично для экономии VRAM.
💡
Совет. Если вы запускаете модель на одном GPU, обязательно добавьте флаг --enable-radix для активации RadixAttention. Это значительно ускорит генерацию при повторных запросах с похожими префиксами (например, в чат-ботах с историей диалога).

03Производительность и бенчмарки

SGLang демонстрирует выдающиеся результаты на современных кластерах. Например, на NVIDIA GB300 NVL72 проект заявляет ускорение инференса в 25 раз по сравнению с базовыми решениями. На NVIDIA GB200 NVL72 проект демонстрирует ускорение в 3.8 раза для префила и в 4.8 раза для декодирования. На AMD Instinct MI300X DeepSeek-R1 показывает значительный прирост пропускной способности декодирования благодаря специализированным оптимизациям.

Для сравнения, SGLang часто обходит vLLM и TensorRT-LLM по скорости префила (prefill) и декодирования (decode) на одинаковом желеде, особенно при работе с длинными контекстами и сложными структурами вывода (JSON, FSM).

Железо Модель (пример) Особенности VRAM (мин.)
NVIDIA H100 (80GB) DeepSeek-V3 (8B/70B) Высокая пропускная способность, поддержка FP8 80GB+ (для 70B)
AMD MI300X DeepSeek-R1 Оптимизации через AITER, высокая эффективность 192GB (всего)
NVIDIA RTX 4090 (24GB) Llama-3-8B (INT4) Локальный запуск, RadixAttention ~6-8GB
Apple M2/M3 Max Llama-3-8B Unified Memory, медленнее GPU, но доступно 32GB+ RAM

04Какое железо кому подойдёт

1. Для разработчиков и энтузиастов (Бюджет: 50-150 тыс. руб.)

Рекомендация: NVIDIA RTX 4090 (24GB) или б/у RTX 3090 (24GB).
Этого достаточно для запуска моделей до 13B параметров в квантованном виде (INT4/AWQ). SGLang на RTX 4090 показывает отличную скорость для локальных чат-ботов. Альтернатива — Apple Mac Studio с M2/M3 Max (64GB+ RAM), если нужно работать с длинными контекстами, но скорость будет ниже, чем на NVIDIA.

2. Для стартапов и малого бизнеса (Бюджет: 500 тыс. - 2 млн руб.)

Рекомендация: Аренда GPU в облаке (Yandex Cloud, Selectel, VK Cloud) или покупка 2x RTX 4090/A5000.
Для продакшена лучше использовать облачные GPU (A100/H100), так как покупка серверного оборудования в РФ сейчас сложна из-за санкций. SGLang отлично масштабируется на несколько GPU. Если есть возможность арендовать 4x A100 (80GB), вы сможете запускать модели до 70B параметров с высокой скоростью.

3. Для крупных компаний и дата-центров (Бюджет: от 10 млн руб.)

Рекомендация: Кластеры NVIDIA H100/H200 или AMD Instinct MI300X.
SGLang поддерживает распределённое параллелизм (Tensor, Pipeline, Expert Parallelism). Для моделей уровня DeepSeek-V3 или GPT-4-подобных систем потребуется кластер из 8+ GPU. SGLang позволяет эффективно использовать все GPU, минимизируя накладные расходы на коммуникацию между ними. Для экономии можно рассмотреть AMD MI300X, которые часто дешевле H100 и показывают сопоставимую производительность с оптимизациями AITER.

⚠️
Важно. При выборе облачного провайдера в РФ убедитесь, что у них есть актуальные версии CUDA (12.1+) и ROCm, так как SGLang требует современных библиотек для работы с FlashAtten

Источник: источник (тест/офиц. документация) ↗