Главная/Блог/Гайд/SGLang на GPU: железо, установка и…
Гайд4 мин чтения · 4 июля 2026 г.

SGLang на GPU: железо, установка и производительность

Разбираем, какое железо нужно для SGLang, как установить рантайм и где искать GPU в РФ. Тесты на H100, AMD MI300X и NVIDIA.

SGLang на GPU: железо, установка и производительность

SGLang (Serving LLMs with Graph) — это высокопроизводительный рантайм для инференса больших языковых моделей. В отличие от классических решений, он использует RadixAttention для кэширования префиксов и поддерживает сложные схемы параллелизма. Для разработчиков в России это актуально не только из-за скорости, но и из-за гибкости поддержки железа: от NVIDIA до AMD и даже TPU. Разберем, на чем запускать SGLang, как его ставить и какие ограничения по VRAM стоит учитывать.

01Поддерживаемое железо и производительность

SGLang заявляет широкую поддержку аппаратной части. В списке совместимых GPU значатся:

  • NVIDIA: H100, A100, GB200, B300, а также потребительские карты вроде RTX 5090 (в контексте новейших архитектур).
  • AMD: Instinct MI300X, MI355.
  • Другие: Intel Xeon (CPU-бэкенд), Google TPUs, Ascend NPUs.

Ключевые цифры производительности, опубликованные разработчиками:

  • На кластере 96 GPU H100 с использованием дисагрегации префилла/декода (PD) и крупномасштабного экспертного параллелизма (EP) удалось достичь значительного прироста пропускной способности для моделей типа DeepSeek.
  • На AMD Instinct MI300X SGLang обеспечивает ускорение инференса DeepSeek-R1, конкурируя с решениями на NVIDIA. Это критично для обхода ограничений на поставки NVIDIA в РФ.
  • На новейших чипах NVIDIA GB300 NVL72 зафиксировано ускорение инференса в 25 раз по сравнению с базовыми конфигурациями благодаря оптимизациям speculative decoding (DFlash и Spec V2).
⚠️
Важно. SGLang активно использует специфические оптимизации для конкретных моделей (например, MLA для DeepSeek). Убедитесь, что версия SGLang поддерживает вашу модель «day-0», иначе вы можете потерять до 50% производительности из-за отсутствия кастомных ядровых оптимизаций.

02Установка и запуск

Установка SGLang стандартна для Python-экосистемы, но требует внимательности с версиями CUDA/ROCm. Для NVIDIA-стэка рекомендуется использовать последние стабильные версии драйверов.

terminalbash
pip install sglang[all]
# Или для установки с поддержкой всех бэкендов
pip install sglang

Для запуска сервера инференса используется команда:

terminalbash
python -m sglang.launch_server --model-path  --host 0.0.0.0 --port 30000

Где <model_name> — это путь к модели в Hugging Face или локальный путь. SGLang автоматически определяет архитектуру и применяет нужные оптимизации (например, RadixAttention для Llama/Qwen/DeepSeek).

03Требования к VRAM и памяти

Объем видеопамяти — главный ограничитель. SGLang поддерживает квантование (FP4, FP8, INT4, AWQ, GPTQ), что позволяет запускать большие модели на меньшем железе.

Железо Модель (пример) VRAM (мин.) Примечание
NVIDIA H100 (80GB) DeepSeek-V3 (671B) ~200GB+ (мультисистемно) Требует EP (Expert Parallelism) на 96+ GPU
AMD MI300X (192GB) DeepSeek-R1 (671B) ~200GB+ (мультисистемно) Оптимизировано через SGLang-Jax/ROCm
NVIDIA A100 (80GB) Llama-3-70B (INT4) ~40-50GB Влезает в одну карту с квантованием
RTX 4090/5090 (24GB) Llama-3-8B (FP16) ~16-20GB Базовый инференс без батчинга
💡
Совет. Если вы используете AMD MI300X, убедитесь, что у вас установлен актуальный стек ROCm и SGLang собран с поддержкой AITER/MoRI. Это дает сопоставимую с NVIDIA производительность на моделях с экспертами (MoE).

04Реальность для РФ: что купить и арендовать

В условиях санкций прямая покупка NVIDIA H100/A100 в РФ затруднена. Однако SGLang открывает альтернативы:

  1. AMD Instinct MI300X: Доступны через серых поставщиков или в облаках. SGLang имеет нативную поддержку, что делает их отличным выбором для тяжелых MoE-моделей (DeepSeek, Mixtral).
  2. Облачные провайдеры: Многие российские облака (Yandex Cloud, Selectel, VK Cloud) предлагают аренду GPU. Ищите инстансы с NVIDIA A100/H100 или AMD MI300X. SGLang легко деплоится через Docker.
  3. Локальные серверы: Для небольших команд можно собрать сервер на RTX 4090/5090. SGLang отлично работает с потребительскими картами, особенно для моделей до 70B параметров с квантованием.

05Какое железо кому подойдёт

1. Стартапы и MVP (Бюджет: 0-500 тыс. руб.)

Железо: 1-2x NVIDIA RTX 4090 (24GB) или аренда A100 в облаке.

Модели: Llama-3-8B, Qwen-2.5-7B, Mistral-7B.

Почему SGLang: Низкая задержка (latency) благодаря RadixAttention. Идеально для чат-ботов с длинным контекстом, где важно кэшировать общие префиксы.

2. Средний бизнес и RAG-системы (Бюджет: 1-5 млн руб.)

Железо: 4x NVIDIA A100 (80GB) или 2x AMD MI300X (192GB).

Модели: Llama-3-70B, Qwen-2.5-72B, DeepSeek-V2/V3 (частично).

Почему SGLang: Поддержка continuous batching и paged attention позволяет обслуживать сотни одновременных запросов. AMD MI300X дает больше VRAM на карту, что упрощает масштабирование.

3. Enterprise и Training/RL (Бюджет: 10+ млн руб.)

Железо: Кластеры из 8-96 GPU (H100/GB200/MI300X).

Модели: DeepSeek-V3, Nemotron, собственные LLM.

Почему SGLang: SGLang — это не только инференс, но и бэкенд для RL-тренинга (AReaL, verl). Поддержка PD-disaggregation (разделение префилла и декода) критична для высоких нагрузок. На GB200 NVL72 достигается максимальная производительность благодаря специализированным оптимизациям.

⚠️
Важно. При использовании AMD GPU убедитесь, что ваша модель имеет поддержку через AITER или AOT. Не все модели из Hugging Face работают «из коробки» без предварительной компиляции ядров.

SGLang становится стандартом де-факто для высоконагруженных LLM-сервисов. Его гибкость в поддержке AMD и NVIDIA делает его стратегически важным выбором для российских компаний, стремящихся к независимости от вендоров.

Источник: Официальная документация ↗