Главная/Блог/Гайд/SGLang: Железо, установка и…
Гайд4 мин чтения · 14 августа 2026 г.

SGLang: Железо, установка и производительность LLM

Разбираем, на каком оборудовании запускать SGLang для максимального инференса. Тесты на NVIDIA, AMD и Apple, требования VRAM и готовые команды.

SGLang (Serving Language) — это высокопроизводительный рантайм для инференса больших языковых моделей (LLM) и мультимодальных систем. В отличие от классических подходов, SGLang использует RadixAttention для кэширования префиксов, что позволяет ускорять генерацию до 5 раз по сравнению с базовыми решениями. Проект активно развивается: поддержка моделей типа Kimi K3, Nemotron 3 Ultra и DeepSeek V4/R1 добавляется «day-0», то есть сразу после релиза модели. Ниже — практическое руководство по выбору железа и настройке.

01Поддерживаемое железо и архитектура

SGLang демонстрирует широкую совместимость, но производительность сильно зависит от типа GPU. Официально поддерживаются:

  • NVIDIA: H100, A100, GB200, B300, RTX 5090, Spark.
  • AMD: Instinct MI300X, MI355.
  • Другие: Intel Xeon (CPU-режим), Google TPUs, Ascend NPUs.

Для локального запуска на потребительском оборудовании ключевым фактором становится объем VRAM. SGLang поддерживает квантование (FP4, FP8, INT4, AWQ, GPTQ), что критически важно для видеокарт с ограниченной памятью.

⚠️
Важно. При использовании NVIDIA GPU убедитесь, что драйверы CUDA обновлены. SGLang активно использует torch.compile и специфичные оптимизации (например, для MLA в DeepSeek), которые могут требовать свежих версий PyTorch и CUDA Toolkit. Несоответствие версий часто приводит к ошибкам сборки или падению производительности.

02Производительность и тесты

В источнике приведены конкретные данные по ускорению на флагманских решениях. SGLang показывает выдающиеся результаты на кластерах NVIDIA GB200 NVL72, обеспечивая рост пропускной способности декодирования (Decode Throughput) в 2.7x–4.8x по сравнению с базовыми настройками при использовании дисагрегации префикса/декода (PD Disaggregation) и экспертного параллелизма (EP).

На AMD Instinct MI300X зафиксировано значительное ускорение инференса DeepSeek-R1 благодаря оптимизациям ROCm. Для локальных тестов часто используются модели типа Llama 3 или Qwen, где SGLang превосходит TensorRT-LLM и vLLM в сценариях с длинными контекстами благодаря эффективному кэшированию.

Железо Модель / Конфиг Результат / Ускорение Примечание
NVIDIA GB200 NVL72 DeepSeek (Large Scale EP) 4.8x Decode Throughput С PD Disaggregation
NVIDIA GB300 NVL72 General LLM Inference 25x Inference Performance По сравнению с базовым запуском
AMD MI300X DeepSeek-R1 High Performance Оптимизации ROCm
NVIDIA H100/A100 DeepSeek V3/V4 Day-0 Support MLA, Sparse Attention

03Установка и запуск

Установка SGLang осуществляется через pip. Для работы с GPU NVIDIA требуется наличие CUDA. Ниже приведена базовая команда для установки последней версии:

terminalbash
pip install sglang[all]

Для запуска сервера инференса используется команда python -m sglang.launch_server. Ключевые флаги для оптимизации:

  • --model-path: путь к модели (Hugging Face ID или локальный путь).
  • --host и --port: настройка сетевого интерфейса.
  • --quantization: выбор метода квантования (fp8, int4, awq) для экономии VRAM.
  • --tp: tensor parallelism (количество GPU для распределения модели).
💡
Совет. Если вы запускаете модель на одной видеокарте с 24 ГБ VRAM (например, RTX 3090/4090), обязательно используйте квантование int4 или awq. Это позволит запустить модели типа Llama-3-70B или Qwen-2.5-72B, которые в полном精度 (FP16) требуют более 140 ГБ памяти.

04VRAM и совместимость в РФ

В условиях импортозамещения и санкций доступ к новым NVIDIA GPU (H100, B200) в РФ ограничен, но на рынке присутствуют A100, H100 (параллельный импорт) и AMD MI300X. SGLang отлично работает на AMD MI300X, что делает его привлекательным для серверов на ROCm. Для домашних лабораторий подходят RTX 3090/4090 (24 ГБ VRAM) — их можно использовать для запуска моделей до 13-20 млрд параметров в квантованном виде.

Apple Silicon (M-серия) в текущей версии SGLang не является основным фокусом (основной упор на CUDA и ROCm), поэтому для Mac рекомендуется использовать другие рантаймы или проверять актуальные форки, так как производительность на Apple GPU может уступать оптимизированным CUDA-бэкендам.

05Какое железо кому подойдёт

  • Энтузиасты / Локальный тест: NVIDIA RTX 3090/4090 (24 ГБ VRAM). Запуск моделей 7B-13B в FP16 или 30B-70B в INT4/AWQ. Цена: ~100-150 тыс. руб. за б/у или новую карту.
  • Малый бизнес / Стартап: Аренда GPU в облаках (Yandex Cloud, Selectel, VK Cloud). Ищите инстансы с A100 (40/80 ГБ) или RTX 4090. SGLang позволяет эффективно масштабировать нагрузку за счет continuous batching.
  • Enterprise / High-Load: Кластеры на NVIDIA H100/A100 или AMD MI300X. Для задач с миллионами запросов в день (агентные системы, GLM5.2, Kimi K3) критически важна поддержка RadixAttention и PD Disaggregation, которые реализованы в SGLang. Стоимость такого кластера исчисляется миллионами рублей, но окупается за счет снижения задержек (latency) и роста TPS (tokens per second).

SGLang — это выбор для тех, кому важна максимальная скорость инференса сложных моделей (DeepSeek, Llama 3, Qwen) и гибкость масштабирования от одной видеокарты до сотен GPU. Начните с установки pip install sglang[all] и тестирования на доступном железе, используя квантование для экономии памяти.

Источник: источник (тест/офиц. документация) ↗