SGLang (Serving Language) — это высокопроизводительный рантайм для инференса больших языковых моделей (LLM) и мультимодальных систем. В отличие от классических подходов, SGLang использует RadixAttention для кэширования префиксов, что позволяет ускорять генерацию до 5 раз по сравнению с базовыми решениями. Проект активно развивается: поддержка моделей типа Kimi K3, Nemotron 3 Ultra и DeepSeek V4/R1 добавляется «day-0», то есть сразу после релиза модели. Ниже — практическое руководство по выбору железа и настройке.
01Поддерживаемое железо и архитектура
SGLang демонстрирует широкую совместимость, но производительность сильно зависит от типа GPU. Официально поддерживаются:
- NVIDIA: H100, A100, GB200, B300, RTX 5090, Spark.
- AMD: Instinct MI300X, MI355.
- Другие: Intel Xeon (CPU-режим), Google TPUs, Ascend NPUs.
Для локального запуска на потребительском оборудовании ключевым фактором становится объем VRAM. SGLang поддерживает квантование (FP4, FP8, INT4, AWQ, GPTQ), что критически важно для видеокарт с ограниченной памятью.
torch.compile и специфичные оптимизации (например, для MLA в DeepSeek), которые могут требовать свежих версий PyTorch и CUDA Toolkit. Несоответствие версий часто приводит к ошибкам сборки или падению производительности.02Производительность и тесты
В источнике приведены конкретные данные по ускорению на флагманских решениях. SGLang показывает выдающиеся результаты на кластерах NVIDIA GB200 NVL72, обеспечивая рост пропускной способности декодирования (Decode Throughput) в 2.7x–4.8x по сравнению с базовыми настройками при использовании дисагрегации префикса/декода (PD Disaggregation) и экспертного параллелизма (EP).
На AMD Instinct MI300X зафиксировано значительное ускорение инференса DeepSeek-R1 благодаря оптимизациям ROCm. Для локальных тестов часто используются модели типа Llama 3 или Qwen, где SGLang превосходит TensorRT-LLM и vLLM в сценариях с длинными контекстами благодаря эффективному кэшированию.
| Железо | Модель / Конфиг | Результат / Ускорение | Примечание |
|---|---|---|---|
| NVIDIA GB200 NVL72 | DeepSeek (Large Scale EP) | 4.8x Decode Throughput | С PD Disaggregation |
| NVIDIA GB300 NVL72 | General LLM Inference | 25x Inference Performance | По сравнению с базовым запуском |
| AMD MI300X | DeepSeek-R1 | High Performance | Оптимизации ROCm |
| NVIDIA H100/A100 | DeepSeek V3/V4 | Day-0 Support | MLA, Sparse Attention |
03Установка и запуск
Установка SGLang осуществляется через pip. Для работы с GPU NVIDIA требуется наличие CUDA. Ниже приведена базовая команда для установки последней версии:
pip install sglang[all]Для запуска сервера инференса используется команда python -m sglang.launch_server. Ключевые флаги для оптимизации:
--model-path: путь к модели (Hugging Face ID или локальный путь).--hostи--port: настройка сетевого интерфейса.--quantization: выбор метода квантования (fp8, int4, awq) для экономии VRAM.--tp: tensor parallelism (количество GPU для распределения модели).
int4 или awq. Это позволит запустить модели типа Llama-3-70B или Qwen-2.5-72B, которые в полном精度 (FP16) требуют более 140 ГБ памяти.04VRAM и совместимость в РФ
В условиях импортозамещения и санкций доступ к новым NVIDIA GPU (H100, B200) в РФ ограничен, но на рынке присутствуют A100, H100 (параллельный импорт) и AMD MI300X. SGLang отлично работает на AMD MI300X, что делает его привлекательным для серверов на ROCm. Для домашних лабораторий подходят RTX 3090/4090 (24 ГБ VRAM) — их можно использовать для запуска моделей до 13-20 млрд параметров в квантованном виде.
Apple Silicon (M-серия) в текущей версии SGLang не является основным фокусом (основной упор на CUDA и ROCm), поэтому для Mac рекомендуется использовать другие рантаймы или проверять актуальные форки, так как производительность на Apple GPU может уступать оптимизированным CUDA-бэкендам.
05Какое железо кому подойдёт
- Энтузиасты / Локальный тест: NVIDIA RTX 3090/4090 (24 ГБ VRAM). Запуск моделей 7B-13B в FP16 или 30B-70B в INT4/AWQ. Цена: ~100-150 тыс. руб. за б/у или новую карту.
- Малый бизнес / Стартап: Аренда GPU в облаках (Yandex Cloud, Selectel, VK Cloud). Ищите инстансы с A100 (40/80 ГБ) или RTX 4090. SGLang позволяет эффективно масштабировать нагрузку за счет continuous batching.
- Enterprise / High-Load: Кластеры на NVIDIA H100/A100 или AMD MI300X. Для задач с миллионами запросов в день (агентные системы, GLM5.2, Kimi K3) критически важна поддержка RadixAttention и PD Disaggregation, которые реализованы в SGLang. Стоимость такого кластера исчисляется миллионами рублей, но окупается за счет снижения задержек (latency) и роста TPS (tokens per second).
SGLang — это выбор для тех, кому важна максимальная скорость инференса сложных моделей (DeepSeek, Llama 3, Qwen) и гибкость масштабирования от одной видеокарты до сотен GPU. Начните с установки pip install sglang[all] и тестирования на доступном железе, используя квантование для экономии памяти.
Источник: источник (тест/офиц. документация) ↗