Главная/Блог/Гайд/SGLang на GPU: выбор железа, установка…
Гайд3 мин чтения · 31 августа 2026 г.

SGLang на GPU: выбор железа, установка и производительность

Разбираем, на каком оборудовании запускать SGLang для инференса LLM. От RTX 5090 до H100: требования VRAM, команды установки и реальные цифры скорости.

SGLang (Serving Language Models) позиционируется как высокопроизводительный рантайм для инференса больших языковых моделей. В отличие от классических решений, он делает ставку на RadixAttention для кэширования префиксов, распараллеливание экспертных параллелизмов (EP) и поддержку современных архитектур, таких как DeepSeek и Kimi. Для разработчиков в РФ и СНГ вопрос выбора железа стоит остро: от доступных потребительских карт до серверных решений. Разберем, что нужно для запуска SGLang, как его установить и какое железо выбрать под разные задачи.

01Поддерживаемое железо и VRAM

Согласно официальной документации SGLang, фреймворк поддерживает широкий спектр аппаратных платформ. Ключевые акценты сделаны на NVIDIA и AMD, но есть и поддержка Intel CPU, Google TPU и Ascend NPU.

Ключевые GPU для SGLang:

  • NVIDIA: GB200, B300, H100, A100, Spark, RTX 5090. Поддержка новейших чипов (GB200/B300) позволяет достигать рекордной пропускной способности при использовании специализированных оптимизаций (например, заметное ускорение декодирования на GB200 NVL72).
  • AMD: Instinct MI355, MI300. SGLang предоставляет day-0 поддержку для AMD, что критично для обхода ограничений на поставки NVIDIA. Тесты показывают высокую эффективность с моделями DeepSeek-R1/V3.
  • Apple: В списке прямого упоминания M-серии нет, но SGLang ориентирован на Linux/Windows серверные среды. Для Mac обычно используют другие рантаймы (например, llama.cpp), хотя экосистема расширяется.
⚠️
Важно. SGLang активно использует квантование (FP4/FP8/INT4/AWQ/GPTQ). Это позволяет запускать модели с большим числом параметров на картах с меньшим объемом VRAM. Например, модели DeepSeek V3/R1 требуют тщательного подбора квантования для укладывания в доступную память, особенно при использовании экспертного параллелизма (EP).

02Установка и запуск

Установка SGLang стандартна для Python-экосистемы. Рекомендуется использовать актуальную версию PyPI. Для работы с AMD GPU потребуется настройка ROCm, для NVIDIA — CUDA.

terminalbash
pip install sglang[all]

Для запуска сервера инференса используется команда python -m sglang.launch_server. Флаги конфигурации включают:

  • --model-path: путь к модели (Hugging Face или локальный).
  • --host и --port: адрес и порт API.
  • --tp (tensor parallel): количество GPU для параллельного запуска (актуально для A100/H100/MI300).
  • --quantization: тип квантования (fp8, int4, awq и др.).

Пример запуска локально на одной GPU (например, RTX 4090/5090 или A100 80GB):

terminalbash
python -m sglang.launch_server \
  --model-path meta-llama/Llama-3.1-8B-Instruct \
  --host 0.0.0.0 \
  --port 30000

03Производительность и реальные сценарии

SGLang демонстрирует выдающиеся результаты в сравнении с vLLM и TensorRT-LLM, особенно в сценариях с длинными контекстами и сложными структурами (DeepSeek, MoE-архитектуры). Ниже приведена сводка данных из источников по производительности на различных платформах.

Железо Модель / Конфигурация Метрика Примечание
NVIDIA GB200 NVL72 DeepSeek (Large Scale EP) Заметное ускорение Ускорение декодирования по сравнению с предыдущими поколениями (H100) при использовании PD Disaggregation.
NVIDIA GB300 NVL72 DeepSeek (Speculative Decoding) 25x Inference Performance Использование next-gen speculative decoding (DFlash/Spec V2).
AMD Instinct MI300X DeepSeek-R1 / V3 High Throughput Day-0 поддержка. Оптимизации для Sparse Attention и MLA.
96x NVIDIA H100 DeepSeek (Large Scale EP) Масштабируемость Успешный деплой с Expert Parallelism. Точные токены/с зависят от модели, но подтверждена стабильность кластера.
NVIDIA (General) GLM5.2 (NVFP4) 500 TPS Agentic workloads. Быстрый старт (2 недели на оптимизацию).
💡
Совет. Если у вас есть доступ к AMD MI300X, обязательно используйте SGLang. Это один из немногих рантаймов, который предлагает полноценную day-0 поддержку без необходимости глубокой перекомпиляции ядра. Для NVIDIA A100/H100 оптимально использовать FP8 или FP4 квантование для увеличения batch size.

04Какое железо кому подойдёт

Выбор оборудования зависит от бюджета и задач. В условиях РФ важно учитывать доступность и стоимость аренды/покупки.

1. Стартап / MVP / Тестирование (Бюджет: Низкий)

  • Железо: 1x NVIDIA RTX 4090 (24GB VRAM) или 1x RTX 5090 (если доступна).
  • Модели: Llama-3.1-8B, Qwen-2.5-7B, Mistral-7B (в квантовании INT4/FP8).
  • Почему: SGLang отлично работает на одном GPU. 24GB VRAM позволяют запустить 7B-модели с большим контекстом. RTX 5090 обещает значительный прирост скорости.
  • Где взять: Купить в РФ (через параллельный импорт), арендовать на Vast.ai или Yandex Cloud (если есть GPU 4090/5090 в пулах).

2. Средний бизнес / Промышленный инференс (Бюджет: Средний)