SGLang (Serving Language) — это высокопроизводительный движок для развертывания больших языковых моделей (LLM) и мультимодальных моделей. В отличие от универсальных фреймворков, SGLang делает ставку на оптимизацию «железа» через такие механизмы, как RadixAttention (кэширование префиксов), непрерывное батчингирование (continuous batching) и дисагрегацию префилла/декода. Это позволяет достигать рекордной пропускной способности даже на ограниченном количестве GPU. Разберем, какое оборудование нужно для запуска SGLang в 2026 году, как его установить и какие подводные камни ждут при выборе VRAM.
01Поддерживаемое железо и экосистема
SGLang позиционируется как кросс-платформенное решение, но его ядро заточено под NVIDIA. Согласно официальным данным, фреймворк поддерживает широкий спектр GPU:
- NVIDIA: От флагманских GB200, B300, H100 до массовых A100 и даже потребительских RTX 5090. Также упоминается поддержка чипов Spark.
- AMD: Instinct MI300 и MI355. Для этих карт существуют специфические оптимизации (например, через ROCm/AITER), позволяющие запускать DeepSeek-R1/V3 с высокой эффективностью.
- Другие: Intel Xeon (CPU-инференс), Google TPUs (через бэкенд SGLang-Jax) и Ascend NPUs.
Ключевая особенность SGLang — поддержка speculative decoding (спекулятивного декодирования) нового поколения (DFlash и Spec V2). Это критически важно для ускорения генерации на современных чипах, таких как GB300 NVL72, где зафиксирован рост производительности до 25x по сравнению с базовыми режимами.
02Установка и базовые команды
Установка SGLang осуществляется через pip. Для большинства пользователей достаточно стандартного пакета, но для работы с конкретными моделями (например, DeepSeek или LLaVA) могут потребоваться дополнительные зависимости. Ниже приведена базовая команда установки:
pip install sglang[all]Для запуска сервера инференса используется команда python -m sglang.launch_server. При запуске на мульти-GPU конфигурациях (например, 8x H100 или 96x H100 для крупных моделей типа DeepSeek) необходимо явно указывать параметры параллелизма:
python -m sglang.launch_server \
--model-path deepseek-v3 \
--tp-size 96 \
--mem-fraction-static 0.9Флаг --tp-size задает размер тензорного параллелизма (количество GPU), а --mem-fraction-static резервирует долю VRAM под KV-кэш. Для моделей с экспертами (MoE), таких как DeepSeek, также активно используется Expert Parallelism (EP), что позволяет масштабировать нагрузку за пределы одной карты.
03Требования к VRAM и производительность
Объем видеопамяти — главный ограничитель при выборе железа. SGLang эффективно управляет памятью через PagedAttention, но базовые требования остаются высокими. Ниже приведена сводка по типичным конфигурациям, основанная на поддержке моделей в SGLang:
| Железо | Пример модели | Оценка VRAM | Примечание по скорости |
|---|---|---|---|
| RTX 5090 (24GB) | Qwen2.5-7B / Llama-3-8B (INT4/AWQ) | ~8-12 GB | Высокая скорость для локального запуска |
| A100 80GB | DeepSeek-V3 (квантованная) | ~40-60 GB | Стабильный инференс, поддержка батчинга |
| H100 80GB | DeepSeek-V3 (полная) | ~80+ GB (требуется TP) | Максимальная пропускная способность |
| GB200 NVL72 | DeepSeek-V3 / R1 | Распределенно | До 2.7x-3.8x прирост декода благодаря PD-дисагрегации |
Обратите внимание: для моделей семейства DeepSeek (V3, R1, V4) SGLang предоставляет оптимизации «Day 0». Это означает, что вы можете запустить их сразу после выхода, без ожидания портов от сообщества. Однако для работы в полную силу (особенно с MLA — Multi-head Latent Attention) требуется GPU с высокой пропускной способностью памяти (HBM3/HBM3e).
04Реальность рынка РФ: что купить или арендовать?
В условиях ограничений на поставки новейших NVIDIA GPU (H100, B200, RTX 5090) в РФ, рынок сформировался вокруг доступных альтернатив:
- Аренда H100/A100: Это стандарт для продакшена. SGLang на 8x H100 показывает эталонную скорость. В РФ эти ресурсы доступны через крупные облачные провайды и специализированные AI-хостинги. Цена высока, но она окупается высокой плотностью запросов.
- AMD Instinct MI300X: Растущая альтернатива. SGLang поддерживает MI300X, и для некоторых моделей (DeepSeek) производительность сопоставима с H100 при меньшей стоимости аренды. Однако экосистема ROCm все еще требует больше танцев с бубном при настройке.
- Локальные решения (RTX 4090/5090): Для небольших команд и тестов SGLang отлично работает на потребительских картах. RTX 5090, поддерживаемая SGLang, предлагает отличный баланс цены и производительности для моделей до 13-20B параметров в квантованном виде. Однако масштабирование на несколько таких карт сложнее из-за отсутствия NVLink.
05Какое железо кому подойдёт
1. Хобби и локальная разработка (Бюджет: 100-200 тыс. руб.)
Железо: 1x RTX 4090 (24GB) или 2x RTX 3090/4090 (PCIe).
Модели: Llama-3-8B, Qwen2.5-7B/14B (в INT4/AWQ), Mistral-7B.
Вердикт: SGLang здесь раскрывается как быстрый рантайм. Вы получите низкую задержку (latency) для интерактивных приложений. VRAM 24GB хватит на 7B-модели с большим контекстом (до 32k-128k токенов с учетом кэширования RadixAttention).
2. Средний бизнес и стартапы (Бюджет: аренда от 50 тыс. руб./мес.)
Железо: 4x A100 80GB или 2x H100 80GB (аренда).
Модели: DeepSeek-V3 (квантованная), Llama-3-70B, Qwen2.5-72B.
Вердикт: A100 — «рабочая лошадка». SGLang на A100 позволяет обслуживать сотни одновременных запросов. Если бюджет позволяет, берите H100 — поддержка FP8 и более быстрый NVLink дадут существенный прирост в throughput для тяжелых моделей.
3. Enterprise и AI-лаборатории (Бюджет: от 500 тыс. руб./мес. и выше)
Железо: GB200 NVL72, 96x H100, или кластеры AMD MI300X.
Модели: DeepSeek-V4, Nemotron 3 Ultra, крупные MoE-модели.
Вердикт: Здесь SGLang используется на полную мощность с дисагрегацией префилла/декода и экспертным параллелизмом. GB200 NVL72 показывает рекордные результаты благодаря сверхбыстрой межсоединению. Это выбор для сервисов, обслуживающих миллионы токенов в секунду.
SGLang доказал, что правильный софт может выжать максимум даже из доступного железа. Но для моделей уровня DeepSeek-V3/V4 без мощных GPU с большим объемом HBM не обойтись. Выбирайте железо под модель, а не наоборот.
Источник: источник (тест/офиц. документация) ↗
