SGLang (Serving LLMs with Graph) — это высокопроизводительный движок инференса, который за последние годы стал стандартом де-факто для запуска больших языковых моделей (LLM). В отличие от классических решений, SGLang делает ставку на RadixAttention для кэширования префиксов, распараллеливание экспертов (EP) и поддержку специфичных оптимизаций для современных архитектур, таких как DeepSeek и Kimi. Но какое железо реально нужно, чтобы увидеть заявленные цифры скорости?
01Производительность и железо: что показывает практика
В источнике приведены конкретные кейсы масштабирования. Ключевым показателем здесь выступает не просто токенов в секунду (tok/s) на одной карте, а пропускная способность кластера (TPS — tokens per second) при распределенном запуске. SGLang демонстрирует выдающиеся результаты на гибридных архитектурах с большим количеством GPU.
Наиболее впечатляющие данные связаны с использованием NVIDIA GB200 NVL72 и GB300. Например, развёртывание DeepSeek на 96 GPU H100 с использованием Parallel Disaggregation (PD) и Large-Scale Expert Parallelism (EP) показало рост пропускной способности декодирования в 2.7–4.8 раза по сравнению с базовыми настройками. А на новейшем чипе GB300 NVL72 удалось разблокировать ускорение инференса в 25 раз.
Для AMD ситуация также благоприятна. Запуски DeepSeek-R1 на AMD Instinct MI300X показывают конкурентоспособные результаты, особенно с учетом того, что SGLang предоставляет day-0 поддержку для этих чипов. Это критически важно, так как AMD активно захватывает долю рынка в сегменте AI-инференса.
| Железо (GPU) | Модель / Конфигурация | Метрика / Результат | Примечание по VRAM/Архитектуре |
|---|---|---|---|
| NVIDIA H100 (96 шт.) | DeepSeek (Large-Scale EP) | 4.8x рост Decode Throughput | Требует NVLink высокого уровня для связи |
| NVIDIA GB300 NVL72 | DeepSeek / General LLM | 25x ускорение инференса | Новейшая архитектура, максимальная производительность |
| AMD Instinct MI300X | DeepSeek-R1 | Высокая пропускная способность | Поддержка через ROCm, оптимизации SGLang |
| NVIDIA A100 | Различные LLM | Стабильный инференс | Базовый уровень для enterprise-развертываний |
02Установка и совместимость: NVIDIA, AMD и Apple
SGLang поддерживает широкий спектр аппаратных платформ. Для NVIDIA требуется CUDA. Для AMD — ROCm. Также есть экспериментальная поддержка Google TPUs (через SGLang-Jax) и Apple Silicon (M-серия), хотя последние в источнике упоминаются скорее как часть экосистемы «Broad Hardware Support», а не как лидеры по скорости инференса для тяжелых моделей.
Важно отметить поддержку квантования: SGLang работает с FP4, FP8, INT4, AWQ и GPTQ. Это позволяет запускать модели, которые не помещаются в VRAM в полном精度, или значительно ускорять инференс за счет снижения требований к пропускной способности памяти.
# Пример установки SGLang для NVIDIA GPU
pip install sglang[all]
# Для AMD Instinct (MI300X/MI355) требуется настройка ROCm
# Убедитесь, что версия ROCm совместима с вашей версией PyTorch
pip install sglang[all] --extra-index-url https://download.pytorch.org/whl/rocm6.003VRAM: сколько нужно под разные модели
Объем видеопамяти — главный ограничитель. SGLang использует PagedAttention, что эффективно управляет памятью, но базовые требования остаются:
- 7B-13B модели (Llama 3, Qwen 2.5): Достаточно одной GPU с 24 ГБ VRAM (RTX 3090/4090) для INT4/AWQ. В FP16 потребуется 2x RTX 3090 или одна A100 80GB.
- 32B-70B модели (DeepSeek V3, Llama 3.1 70B): Требуются мульти-GPU конфигурации. Для 70B в FP16 нужно ~140 ГБ VRAM, что означает 2x A100 80GB или 4x RTX 4090 (с осторожностью из-за PCIe). SGLang позволяет эффективно распределять нагрузку через Tensor Parallelism.
- Модели с MoE (Mixture of Experts): Такие как DeepSeek V3/R1. SGLang оптимизирован для Expert Parallelism. На AMD MI300X это особенно эффективно благодаря высокой пропускной способности памяти HBM3.
04Реальность рынка РФ: что купить и арендовать
В условиях санкций прямые поставки NVIDIA H100/A100 в РФ затруднены. Однако SGLang поддерживает AMD Instinct MI300X, которые также сложно достать, но есть альтернативы. Для локальных развертываний часто используют NVIDIA RTX 4090 (24GB) или б/у A100/A6000. SGLang отлично работает на RTX 4090 благодаря поддержке CUDA 12.x и оптимизациям torch.compile.
Для облачных вычислений в РФ популярны сервисы, предоставляющие доступ к A100 и V100. SGLang совместим с ними, но для максимальной производительности на DeepSeek рекомендуется искать провайдеров с AMD MI300X или NVIDIA H100, так как именно под эти чипы сделан основной упор в последних оптимизациях (Day-0 support).
05Какое железо кому подойдёт
- Энтузиасты / Small Team (Бюджет до 300 тыс. руб.): 2-4x NVIDIA RTX 4090. SGLang позволит запускать модели до 32B параметров в квантованном виде. Идеально для тестирования и небольших сервисов.
- Enterprise / Production (Бюджет от 1 млн руб.): Аренда или покупка кластеров на NVIDIA A100 80GB или AMD Instinct MI300X. Для моделей типа DeepSeek V3/R1 или Kimi K3 необходимо масштабное распараллеливание (EP/PD). Здесь SGLang раскрывает свой потенциал, показывая 2.7x-4.8x прирост производительности.
- Research / MLops: Использование Google TPUs через SGLang-Jax. Это нишевое решение, но оно дает доступ к высокопроизводительным TPU v4/v5p для экспериментов без привязки к NVIDIA.
SGLang — это не просто еще один рантайм, а инструмент, который адаптируется под железо. Если у вас есть AMD MI300X, не игнорируйте SGLang — там есть специфичные оптимизации, которых нет в vLLM. Если у вас NVIDIA, выбирайте SGLang для работы с новыми архитектурами (DeepSeek, Kimi) и квантованием FP4/FP8.
Источник: источник (тест/офиц. документация) ↗
