SGLang (Serving LLMs with Graph) — это высокопроизводительный рантайм для инференса больших языковых моделей. В отличие от классических решений, он использует RadixAttention для кэширования префиксов и поддерживает сложные схемы параллелизма. Для разработчиков в России это актуально не только из-за скорости, но и из-за гибкости поддержки железа: от NVIDIA до AMD и даже TPU. Разберем, на чем запускать SGLang, как его ставить и какие ограничения по VRAM стоит учитывать.
01Поддерживаемое железо и производительность
SGLang заявляет широкую поддержку аппаратной части. В списке совместимых GPU значатся:
- NVIDIA: H100, A100, GB200, B300, а также потребительские карты вроде RTX 5090 (в контексте новейших архитектур).
- AMD: Instinct MI300X, MI355.
- Другие: Intel Xeon (CPU-бэкенд), Google TPUs, Ascend NPUs.
Ключевые цифры производительности, опубликованные разработчиками:
- На кластере 96 GPU H100 с использованием дисагрегации префилла/декода (PD) и крупномасштабного экспертного параллелизма (EP) удалось достичь значительного прироста пропускной способности для моделей типа DeepSeek.
- На AMD Instinct MI300X SGLang обеспечивает ускорение инференса DeepSeek-R1, конкурируя с решениями на NVIDIA. Это критично для обхода ограничений на поставки NVIDIA в РФ.
- На новейших чипах NVIDIA GB300 NVL72 зафиксировано ускорение инференса в 25 раз по сравнению с базовыми конфигурациями благодаря оптимизациям speculative decoding (DFlash и Spec V2).
02Установка и запуск
Установка SGLang стандартна для Python-экосистемы, но требует внимательности с версиями CUDA/ROCm. Для NVIDIA-стэка рекомендуется использовать последние стабильные версии драйверов.
pip install sglang[all]
# Или для установки с поддержкой всех бэкендов
pip install sglangДля запуска сервера инференса используется команда:
python -m sglang.launch_server --model-path --host 0.0.0.0 --port 30000 Где <model_name> — это путь к модели в Hugging Face или локальный путь. SGLang автоматически определяет архитектуру и применяет нужные оптимизации (например, RadixAttention для Llama/Qwen/DeepSeek).
03Требования к VRAM и памяти
Объем видеопамяти — главный ограничитель. SGLang поддерживает квантование (FP4, FP8, INT4, AWQ, GPTQ), что позволяет запускать большие модели на меньшем железе.
| Железо | Модель (пример) | VRAM (мин.) | Примечание |
|---|---|---|---|
| NVIDIA H100 (80GB) | DeepSeek-V3 (671B) | ~200GB+ (мультисистемно) | Требует EP (Expert Parallelism) на 96+ GPU |
| AMD MI300X (192GB) | DeepSeek-R1 (671B) | ~200GB+ (мультисистемно) | Оптимизировано через SGLang-Jax/ROCm |
| NVIDIA A100 (80GB) | Llama-3-70B (INT4) | ~40-50GB | Влезает в одну карту с квантованием |
| RTX 4090/5090 (24GB) | Llama-3-8B (FP16) | ~16-20GB | Базовый инференс без батчинга |
04Реальность для РФ: что купить и арендовать
В условиях санкций прямая покупка NVIDIA H100/A100 в РФ затруднена. Однако SGLang открывает альтернативы:
- AMD Instinct MI300X: Доступны через серых поставщиков или в облаках. SGLang имеет нативную поддержку, что делает их отличным выбором для тяжелых MoE-моделей (DeepSeek, Mixtral).
- Облачные провайдеры: Многие российские облака (Yandex Cloud, Selectel, VK Cloud) предлагают аренду GPU. Ищите инстансы с NVIDIA A100/H100 или AMD MI300X. SGLang легко деплоится через Docker.
- Локальные серверы: Для небольших команд можно собрать сервер на RTX 4090/5090. SGLang отлично работает с потребительскими картами, особенно для моделей до 70B параметров с квантованием.
05Какое железо кому подойдёт
1. Стартапы и MVP (Бюджет: 0-500 тыс. руб.)
Железо: 1-2x NVIDIA RTX 4090 (24GB) или аренда A100 в облаке.
Модели: Llama-3-8B, Qwen-2.5-7B, Mistral-7B.
Почему SGLang: Низкая задержка (latency) благодаря RadixAttention. Идеально для чат-ботов с длинным контекстом, где важно кэшировать общие префиксы.
2. Средний бизнес и RAG-системы (Бюджет: 1-5 млн руб.)
Железо: 4x NVIDIA A100 (80GB) или 2x AMD MI300X (192GB).
Модели: Llama-3-70B, Qwen-2.5-72B, DeepSeek-V2/V3 (частично).
Почему SGLang: Поддержка continuous batching и paged attention позволяет обслуживать сотни одновременных запросов. AMD MI300X дает больше VRAM на карту, что упрощает масштабирование.
3. Enterprise и Training/RL (Бюджет: 10+ млн руб.)
Железо: Кластеры из 8-96 GPU (H100/GB200/MI300X).
Модели: DeepSeek-V3, Nemotron, собственные LLM.
Почему SGLang: SGLang — это не только инференс, но и бэкенд для RL-тренинга (AReaL, verl). Поддержка PD-disaggregation (разделение префилла и декода) критична для высоких нагрузок. На GB200 NVL72 достигается максимальная производительность благодаря специализированным оптимизациям.
SGLang становится стандартом де-факто для высоконагруженных LLM-сервисов. Его гибкость в поддержке AMD и NVIDIA делает его стратегически важным выбором для российских компаний, стремящихся к независимости от вендоров.
Источник: Официальная документация ↗
