Главная/Блог/Гайд/SGLang на GPU: выбор железа, установка…
Гайд5 мин чтения · 14 июля 2026 г.

SGLang на GPU: выбор железа, установка и производительность

Разбираем, на каком оборудовании запускать SGLang для инференса LLM. От RTX 5090 до H100: требования VRAM, команды установки и реальные сценарии использования.

SGLang на GPU: выбор железа, установка и производительность

SGLang (Serving Language) — это высокопроизводительный движок для развертывания больших языковых моделей (LLM) и мультимодальных моделей. В отличие от универсальных фреймворков, SGLang делает ставку на оптимизацию «железа» через такие механизмы, как RadixAttention (кэширование префиксов), непрерывное батчингирование (continuous batching) и дисагрегацию префилла/декода. Это позволяет достигать рекордной пропускной способности даже на ограниченном количестве GPU. Разберем, какое оборудование нужно для запуска SGLang в 2026 году, как его установить и какие подводные камни ждут при выборе VRAM.

01Поддерживаемое железо и экосистема

SGLang позиционируется как кросс-платформенное решение, но его ядро заточено под NVIDIA. Согласно официальным данным, фреймворк поддерживает широкий спектр GPU:

  • NVIDIA: От флагманских GB200, B300, H100 до массовых A100 и даже потребительских RTX 5090. Также упоминается поддержка чипов Spark.
  • AMD: Instinct MI300 и MI355. Для этих карт существуют специфические оптимизации (например, через ROCm/AITER), позволяющие запускать DeepSeek-R1/V3 с высокой эффективностью.
  • Другие: Intel Xeon (CPU-инференс), Google TPUs (через бэкенд SGLang-Jax) и Ascend NPUs.

Ключевая особенность SGLang — поддержка speculative decoding (спекулятивного декодирования) нового поколения (DFlash и Spec V2). Это критически важно для ускорения генерации на современных чипах, таких как GB300 NVL72, где зафиксирован рост производительности до 25x по сравнению с базовыми режимами.

⚠️
Важно. При выборе AMD GPU (MI300X/MI355) убедитесь, что ваша версия SGLang и драйверы ROCm актуальны. Поддержка этих карт часто требует сборки с флагами, отличными от стандартного CUDA-стека, и может быть менее стабильной на потребительских ОС по сравнению с NVIDIA.

02Установка и базовые команды

Установка SGLang осуществляется через pip. Для большинства пользователей достаточно стандартного пакета, но для работы с конкретными моделями (например, DeepSeek или LLaVA) могут потребоваться дополнительные зависимости. Ниже приведена базовая команда установки:

terminalbash
pip install sglang[all]

Для запуска сервера инференса используется команда python -m sglang.launch_server. При запуске на мульти-GPU конфигурациях (например, 8x H100 или 96x H100 для крупных моделей типа DeepSeek) необходимо явно указывать параметры параллелизма:

terminalbash
python -m sglang.launch_server \
    --model-path deepseek-v3 \
    --tp-size 96 \
    --mem-fraction-static 0.9

Флаг --tp-size задает размер тензорного параллелизма (количество GPU), а --mem-fraction-static резервирует долю VRAM под KV-кэш. Для моделей с экспертами (MoE), таких как DeepSeek, также активно используется Expert Parallelism (EP), что позволяет масштабировать нагрузку за пределы одной карты.

03Требования к VRAM и производительность

Объем видеопамяти — главный ограничитель при выборе железа. SGLang эффективно управляет памятью через PagedAttention, но базовые требования остаются высокими. Ниже приведена сводка по типичным конфигурациям, основанная на поддержке моделей в SGLang:

Железо Пример модели Оценка VRAM Примечание по скорости
RTX 5090 (24GB) Qwen2.5-7B / Llama-3-8B (INT4/AWQ) ~8-12 GB Высокая скорость для локального запуска
A100 80GB DeepSeek-V3 (квантованная) ~40-60 GB Стабильный инференс, поддержка батчинга
H100 80GB DeepSeek-V3 (полная) ~80+ GB (требуется TP) Максимальная пропускная способность
GB200 NVL72 DeepSeek-V3 / R1 Распределенно До 2.7x-3.8x прирост декода благодаря PD-дисагрегации

Обратите внимание: для моделей семейства DeepSeek (V3, R1, V4) SGLang предоставляет оптимизации «Day 0». Это означает, что вы можете запустить их сразу после выхода, без ожидания портов от сообщества. Однако для работы в полную силу (особенно с MLA — Multi-head Latent Attention) требуется GPU с высокой пропускной способностью памяти (HBM3/HBM3e).

💡
Совет. Если вы запускаете модели с экспертами (MoE), не экономьте на пропускной способности шины между GPU. В кластерах типа GB200 или H100 NVLink критически важен для синхронизации экспертов. На обычных PCIe-связках (например, в серверах с A100) производительность MoE-моделей может упасть на 30-50%.

04Реальность рынка РФ: что купить или арендовать?

В условиях ограничений на поставки новейших NVIDIA GPU (H100, B200, RTX 5090) в РФ, рынок сформировался вокруг доступных альтернатив:

  1. Аренда H100/A100: Это стандарт для продакшена. SGLang на 8x H100 показывает эталонную скорость. В РФ эти ресурсы доступны через крупные облачные провайды и специализированные AI-хостинги. Цена высока, но она окупается высокой плотностью запросов.
  2. AMD Instinct MI300X: Растущая альтернатива. SGLang поддерживает MI300X, и для некоторых моделей (DeepSeek) производительность сопоставима с H100 при меньшей стоимости аренды. Однако экосистема ROCm все еще требует больше танцев с бубном при настройке.
  3. Локальные решения (RTX 4090/5090): Для небольших команд и тестов SGLang отлично работает на потребительских картах. RTX 5090, поддерживаемая SGLang, предлагает отличный баланс цены и производительности для моделей до 13-20B параметров в квантованном виде. Однако масштабирование на несколько таких карт сложнее из-за отсутствия NVLink.

05Какое железо кому подойдёт

1. Хобби и локальная разработка (Бюджет: 100-200 тыс. руб.)

Железо: 1x RTX 4090 (24GB) или 2x RTX 3090/4090 (PCIe).

Модели: Llama-3-8B, Qwen2.5-7B/14B (в INT4/AWQ), Mistral-7B.

Вердикт: SGLang здесь раскрывается как быстрый рантайм. Вы получите низкую задержку (latency) для интерактивных приложений. VRAM 24GB хватит на 7B-модели с большим контекстом (до 32k-128k токенов с учетом кэширования RadixAttention).

2. Средний бизнес и стартапы (Бюджет: аренда от 50 тыс. руб./мес.)

Железо: 4x A100 80GB или 2x H100 80GB (аренда).

Модели: DeepSeek-V3 (квантованная), Llama-3-70B, Qwen2.5-72B.

Вердикт: A100 — «рабочая лошадка». SGLang на A100 позволяет обслуживать сотни одновременных запросов. Если бюджет позволяет, берите H100 — поддержка FP8 и более быстрый NVLink дадут существенный прирост в throughput для тяжелых моделей.

3. Enterprise и AI-лаборатории (Бюджет: от 500 тыс. руб./мес. и выше)

Железо: GB200 NVL72, 96x H100, или кластеры AMD MI300X.

Модели: DeepSeek-V4, Nemotron 3 Ultra, крупные MoE-модели.

Вердикт: Здесь SGLang используется на полную мощность с дисагрегацией префилла/декода и экспертным параллелизмом. GB200 NVL72 показывает рекордные результаты благодаря сверхбыстрой межсоединению. Это выбор для сервисов, обслуживающих миллионы токенов в секунду.

SGLang доказал, что правильный софт может выжать максимум даже из доступного железа. Но для моделей уровня DeepSeek-V3/V4 без мощных GPU с большим объемом HBM не обойтись. Выбирайте железо под модель, а не наоборот.

Источник: источник (тест/офиц. документация) ↗