SGLang (Serving Language Models) позиционируется как высокопроизводительный движок для инференса больших языковых моделей (LLM) и мультимодальных систем. Проект, поддерживаемый сообществом LMSYS, обрабатывает триллионы токенов ежедневно и используется более чем 400 000 GPU. Ключевая особенность SGLang — архитектура RadixAttention для кэширования префиксов, распараллеливание тензоров/пайплайнов/экспертов и поддержка специфичных оптимизаций для современных архитектур (DeepSeek, Kimi, GLM). В этой статье разберем, какое железо реально нужно для запуска SGLang, как его установить и какие модели поддерживаются.
01Поддерживаемое железо и производительность
SGLang демонстрирует широкую совместимость с аппаратным обеспечением. В официальной документации и блогах проекта упоминаются следующие платформы:
- NVIDIA: GB200, B300, H100, A100, Spark, RTX 5090.
- AMD: Instinct MI355, MI300X.
- Другие: Intel Xeon (CPU), Google TPUs, Ascend NPUs.
Производительность сильно зависит от масштаба развертывания. Например, для модели DeepSeek-R1 на кластере из 96 GPU H100 с использованием дисагрегации префила/декода (PD) и крупномасштабного параллелизма экспертов (EP), достигается значительный прирост пропускной способности. На NVIDIA GB200 NVL72 зафиксировано ускорение инференса в 25 раз по сравнению с базовыми настройками. Для AMD Instinct MI300X также опубликованы результаты разблокировки производительности DeepSeek-R1 и DeepSeek-V3 с использованием специфичных оптимизаций SGLang.
02Установка и запуск
Установка SGLang осуществляется через pip. Для работы требуется актуальная версия Python и CUDA (для NVIDIA) или ROCm (для AMD). Ниже приведена базовая команда установки:
pip install sglang[all]Для запуска сервера инференса используется стандартная команда запуска с указанием модели и порта. Пример для локального запуска на одной GPU:
python -m sglang.launch_server --model-path lmsys/vicuna-7b-v1.5 --port 30000Для распределенных кластеров (например, на H100 или A100) необходимо использовать флаги для tensor parallelism (tp) и специфичные хосты. SGLang также поддерживает запуск на TPU через бэкенд SGLang-Jax, что открывает возможности для работы в Google Cloud.
03Поддержка моделей
SGLang предоставляет "day-0" поддержку для многих новых моделей, что означает немедленную оптимизацию после их выхода. Среди поддерживаемых:
- LLM: Llama, Qwen, DeepSeek (V3, V4, R1, R1.5), Kimi (K3), GLM (GLM5.2), GPT, Gemma, Mistral.
- Мультимодальные: LLaVA-OneVision, Nemotron 3 Ultra/Super/Nano.
- Диффузионные модели: WAN, Qwen-Image, Higgs Audio v3 (TTS).
Особое внимание уделено оптимизациям для DeepSeek. SGLang поддерживает специфичные для DeepSeek механизмы, такие как MLA (Multi-head Latent Attention), что позволяет ускорить инференс в 7 раз по сравнению с предыдущими версиями. Также добавлена поддержка OpenAI gpt-oss модели.
04Какое железо кому подойдёт
Выбор железа для SGLang зависит от бюджета и задач. Вот честные рекомендации для рынка РФ:
1. Стартапы и небольшие команды (Бюджет: 500 тыс. – 2 млн руб.)
Железо: 2-4x NVIDIA RTX 4090 (24GB VRAM) или RTX 5090 (если доступны). Альтернатива: аренда GPU в облаках (Yandex Cloud, Selectel).
Модели: Llama-3-8B, Qwen-2.5-7B, DeepSeek-R1-Distill-Qwen-7B (в квантованном виде INT4/AWQ).
Производительность: Высокая скорость генерации для небольших моделей. Для DeepSeek-V3 потребуется квантование FP8/INT4 и, возможно, 8x RTX 4090 для комфортной работы.
2. Средний бизнес и хостинг (Бюджет: 5 – 15 млн руб.)
Железо: NVIDIA A100 (40GB/80GB) или H100 (если есть доступ через партнеров). В РФ H100 купить сложно, но можно арендовать. A100 более доступны на вторичном рынке.
Модели: DeepSeek-V3, Llama-3-70B, Qwen-2.5-72B.
Производительность: A100 80GB позволяет запускать 70B модели в FP16 с небольшим кэшированием. H100 обеспечивает максимальную пропускную способность для тяжелых нагрузок.
3. Enterprise и крупные проекты (Бюджет: от 20 млн руб. и выше)
Железо: Кластеры из NVIDIA H100/H200 или AMD MI300X. В РФ H20 является легальной альтернативой H100, но с урезанной межпроцессорной связью. Для SGLang важна скорость NVLink, поэтому H20 может уступать H100 в распределенных задачах.
Модели: DeepSeek-V4, Kimi K3, GLM5.2, большие мультимодальные модели.
Производительность: Использование PD-дисагрегации и EP-параллелизма позволяет обрабатывать тысячи запросов в секунду. Для AMD MI300X требуется настройка ROCm, но производительность сопоставима с NVIDIA при правильной оптимизации.
SGLang — это мощный инструмент, который позволяет извлекать максимум из доступного железа. Выбор между NVIDIA и AMD зависит от доступности и готовности к настройке. Для большинства задач в РФ оптимальным стартом будет использование RTX 4090/5090 для легких моделей или аренда A100/H200 для тяжелых LLM.
Источник: источник (тест/офиц. документация) ↗