SGLang (Serving LLMs with Graph) — это высокопроизводительный рантайм для инференса больших языковых моделей (LLM) и мультимодальных моделей. Проект, поддерживаемый сообществом LMSYS, позиционируется как решение для обеспечения низкой задержки и высокой пропускной способности как на одиночных GPU, так и в распределённых кластерах. В отличие от универсальных фреймворков, SGLang делает ставку на специфические оптимизации ядра, такие как RadixAttention для кэширования префиксов и дисагрегация префил/декода (PD Disaggregation). Для российских разработчиков и энтузиастов, стремящихся запустить современные модели (DeepSeek, Llama, Qwen) локально или в облаке, понимание аппаратных требований критически важно.
01Поддерживаемое железо и архитектура
Официальная документация SGLang указывает на широкую совместимость с современным аппаратным обеспечением. Ядро системы оптимизировано для следующих платформ:
- NVIDIA GPUs: Поддержка включает флагманские решения H100, GB200, GB300, а также более доступные A100 и потребительские карты серии RTX (включая упоминание 5090 в контексте будущих/текущих бета-тестов). Также упоминается поддержка чипов Spark.
- AMD GPUs: Активная поддержка ускорителей Instinct MI300X и MI355. SGLang предоставляет специфические оптимизации для архитектуры CDNA, что делает AMD-решения конкурентоспособной альтернативой NVIDIA в условиях ограничений на поставки.
- Другие ускорители: Поддержка Intel Xeon CPU (для CPU-инференса или гибридных сценариев), Google TPUs (через бэкенд SGLang-Jax) и Ascend NPUs (Huawei).
- Apple Silicon: Хотя в кратком описании README акцент сделан на серверные GPU, экосистема SGLang активно развивается для работы с M-серией (M1/M2/M3 Max/Ultra) через оптимизации памяти Unified Memory, что позволяет запускать модели среднего размера на Mac Studio.
02Производительность и тесты
Результаты бенчмарков SGLang демонстрируют впечатляющие цифры, особенно при использовании современных архитектур NVIDIA и оптимизаций для DeepSeek. Ниже приведены ключевые данные из официальных блогов проекта:
| Железо | Модель / Конфигурация | Метрика | Примечание |
|---|---|---|---|
| NVIDIA GB300 NVL72 | DeepSeek (оптимизировано) | 25x ускорение | По сравнению с предыдущим поколением/базовой настройкой |
| NVIDIA GB200 NVL72 | DeepSeek (PD + Large Scale EP) | 3.8x Prefill / 4.8x Decode | Ускорение по сравнению с базовым запуском |
| 96x NVIDIA H100 | DeepSeek (Large Scale EP) | Высокий Throughput | Использование Expert Parallelism |
| AMD Instinct MI300X | DeepSeek-R1 | Конкурентоспособно | Специфические оптимизации от AMD и SGLang |
| GLM5.2 (NVFP4) | Agentic Workloads | 500 TPS | Достигнуто за 2 недели оптимизации |
Обратите внимание: для достижения таких показателей требуется не просто одна карта, а кластеры (NVL72 — это связка из 72 GPU с высокой скоростью соединения NVLink). Для локального запуска на одной карте RTX 4090 или A100 производительность будет измеряться в десятках токенов в секунду, а не тысячах.
03Установка и сборка
SGLang распространяется через PyPI. Для установки на NVIDIA GPU требуется CUDA. Для AMD GPU необходим ROCm. Ниже приведена базовая команда установки:
pip install sglang[all]Для запуска сервера инференса используется стандартная команда запуска бэкенда. Пример запуска модели Llama-3 с использованием SGLang:
python -m sglang.launch_server --model-path meta-llama/Llama-3-70b-instruct --host 0.0.0.0 --port 30000При работе с моделями DeepSeek V3/R1 рекомендуется использовать специфические флаги для активации MLA (Multi-Head Latent Attention), что значительно снижает потребление памяти и повышает скорость. Для AMD карт может потребоваться установка дополнительных зависимостей через conda для корректной работы с ROCm.
04Какое железо кому подойдёт
Выбор оборудования для SGLang зависит от масштаба задач и бюджета. В условиях российского рынка, где прямые поставки новейших NVIDIA GPU ограничены, ситуация выглядит следующим образом:
1. Локальный энтузиаст / Малый бизнес (Бюджет: 100–300 тыс. руб.)
- Железо: 1x NVIDIA RTX 4090 (24GB VRAM) или 2x RTX 3090/4090 (NVLink не обязателен, но полезен для некоторых конфигураций).
- Модели: Llama-3-8B, Qwen-2.5-7B/14B, DeepSeek-R1-Distill-Qwen-7B/14B (квантованные до INT4/AWQ).
- Реальность: SGLang покажет себя лучше, чем vLLM, за счёт RadixAttention. Вы получите быстрый отклик на короткие запросы. Для 70B моделей потребуется квантование до 4-бит, что снизит качество, но сделает запуск возможным.
2. Серверная разработка / Облако (Бюджет: 1–5 млн руб. / аренда)
- Железо: NVIDIA A100 (40/80GB) или H100 (если доступно через облачных провайдеров в РФ, таких как Selectel, Yandex Cloud, VK Cloud). Альтернатива: AMD MI300X (появляются в некоторых дата-центрах).
- Модели: Llama-3-70B, Qwen-2.5-72B, DeepSeek-V3 (в квантованном виде).
- Реальность: A100 80GB позволяет запускать 70B модели в FP16/BF16 без сильного квантования. SGLang здесь раскрывается полностью: дисагрегация префил/декода позволяет обслуживать больше пользователей одновременно. AMD MI300X предлагает больше VRAM (192GB) за меньшие деньги, что критично для длинных контекстов.
3. Enterprise / Кластер (Бюджет: от 10 млн руб.)
- Железо: Кластеры из 8x H100/A100 или специализированные решения на базе GB200/GB300 (через партнёров или облако).
- Модели: DeepSeek-V3, GLM-4, большие мультимодальные модели.
- Реальность: SGLang показывает здесь максимальную эффективность. Использование Expert Parallelism (EP) и PD Disaggregation позволяет обрабатывать тысячи запросов в секунду. Для таких задач критична скорость соединения между GPU (NVLink/NVSwitch).
В заключение, SGLang — это мощный инструмент, который требует соответствующего железа. Для старта достаточно одной RTX 4090, но для серьёзной работы с большими моделями (70B+) лучше ориентироваться на A100/H100 или AMD MI300X в облаке. Следите за обновлениями SGLang, так как поддержка новых моделей (таких как Kimi K3, Nemotron 3 Ultra) выходит «day-0», что позволяет сразу использовать все оптимизации производительности.
Источник: источник (тест/офиц. документация) ↗
