Главная/Блог/Гайд/SGLang на GPU: железо, установка и…
Гайд4 мин чтения · 29 сентября 2026 г.

SGLang на GPU: железо, установка и производительность

Разбираем, на каком оборудовании запускать SGLang для инференса LLM. От RTX 5090 до H100: требования VRAM, команды установки и реальные цифры скорости.

SGLang (Serving Language) — это высокопроизводительный движок для развертывания больших языковых моделей (LLM) и мультимодальных систем. В отличие от универсальных фреймворков, SGLang делает ставку на оптимизацию «железа» через RadixAttention (кэширование префиксов), непрерывное батчингирование и поддержку специфичных архитектур, таких как MLA (Multi-Head Latent Attention) в DeepSeek. Для российских разработчиков и компаний, ищущих способ запустить LLM локально или в облаке, понимание аппаратных требований критически важно, так как SGLang требует точной настройки под конкретный GPU.

01Поддерживаемое железо и VRAM

Согласно официальной документации, SGLang демонстрирует широкую совместимость с современным оборудованием. Ключевые платформы включают:

  • NVIDIA: От потребительских карт до серверных решений (A100, H100, GB200, B300). Особое внимание уделено оптимизации для GB200 NVL72, где зафиксирован заметный рост пропускной способности декодирования по сравнению с предыдущими поколениями.
  • AMD: Поддержка Instinct MI300X. Для этих карт существуют специфичные блоги от AMD, демонстрирующие ускорение инференса DeepSeek-R1/V3.
  • Apple: Хотя в списке явных упоминаний M-серии нет, экосистема Apple Silicon часто поддерживается через общие бэкенды, однако для максимальной производительности SGLang фокусируется на GPU с высокой пропускной способностью памяти (HBM).
⚠️
Важно. SGLang активно использует квантование (FP4, FP8, INT4, AWQ, GPTQ). Это позволяет запускать модели, которые не помещаются в VRAM в полном формате (FP16/BF16). Например, использование FP4 для GLM5.2 позволило достичь высокой пропускной способности (500 TPS) на ограниченных ресурсах. Всегда проверяйте доступные веса модели под вашу версию VRAM.

02Установка и запуск

Установка SGLang осуществляется через pip. Для NVIDIA GPU требуется CUDA. Ниже приведена базовая команда для установки последней версии:

terminalbash
pip install sglang[all]

Для AMD Instinct или других специфичных архитектур могут потребоваться дополнительные флаги или сборка из исходного кода с поддержкой ROCm. Важно отметить, что SGLang поддерживает запуск как на одном GPU, так и в распределенных кластерах с использованием тензорного, конвейерного и экспертного параллелизма (EP).

03Производительность: цифры из источников

В источнике приведены конкретные кейсы оптимизации, которые демонстрируют потенциал железа в связке с SGLang:

Железо Модель / Конфигурация Результат / Примечание
GB200 NVL72 DeepSeek (PD + Large Scale EP) Заметный рост декодирования (Part I), 4.8x рост (Part II)
GB300 NVL72 General Inference 25x ускорение инференса (по сравнению с базовыми решениями)
96x H100 DeepSeek (Large Scale EP) Масштабируемый запуск сложных моделей
GLM5.2 (NVFP4) Agentic Workloads 500 TPS (токенов в секунду) за 2 недели оптимизации
AMD MI300X DeepSeek-R1/V3 Поддержка Day-0, значительное ускорение через ROCm

Обратите внимание: SGLang также поддерживает speculative decoding (спекулятивное декодирование) через DFlash и Spec V2, что дополнительно повышает скорость генерации токенов без потери качества.

💡
Совет. Если вы используете NVIDIA GPU, убедитесь, что у вас установлены последние драйверы и CUDA Toolkit. SGLang тесно интегрирован с PyTorch, и использование torch.compile может дать прирост скорости. Для AMD карт обязательно используйте бэкенд AITER/MoRI, доступный в последних релизах.

04Какое железо кому подойдёт

1. Локальный запуск и тестирование (Бюджет: 100–300 тыс. руб.)

Железо: NVIDIA RTX 4090 (24GB VRAM) или RTX 5090 (если доступна в РФ через параллельный импорт, 32GB+ VRAM).

Что запустить: Модели до 70B параметров в квантованном виде (Q4_K_M или FP8). SGLang отлично справится с Llama-3-70B или Qwen-2.5-72B в 4-битном квантовании. Для 24GB VRAM RTX 4090 это будет предел, но скорость инференса будет высокой благодаря высокой пропускной способности памяти.

2. Серверный инференс для бизнеса (Бюджет: 1–5 млн руб. за ноду)

Железо: NVIDIA A100 (40/80GB) или H100 (80GB). В РФ эти карты можно арендовать у крупных облачных провайдеров (Selectel, Yandex Cloud, VK Cloud) или купить б/у A100.

Что запустить: Модели до 130B параметров (например, DeepSeek-V3 в FP8) или несколько моделей среднего размера (7B/13B) с высокой нагрузкой. SGLang позволит обслуживать сотни запросов в секунду благодаря RadixAttention.

3. High-Performance Computing / AI-стартапы (Бюджет: от 10 млн руб.)

Железо: Кластеры из H100/H200 или AMD MI300X. В РФ доступ к новым H100 ограничен, поэтому альтернативой могут стать AMD MI300X, которые поддерживаются SGLang «из коробки» (Day-0 support).

Что запустить: Крупные мультимодальные модели, RL-тренировка (SGLang используется как бэкенд для rollout), или высоконагруженные агенты (GLM5.2, Kimi K3). Здесь критична пропускная способность между GPU (NVLink/InfiniBand), которую обеспечивает SGLang через distributed parallelism.

Итог: SGLang — это выбор для тех, кому важна максимальная скорость инференса и эффективное использован

Источник: источник (тест/офиц. документация) ↗