Главная/Блог/Гайд/SGLang: Железо для быстрого инференса…
Гайд5 мин чтения · 4 августа 2026 г.

SGLang: Железо для быстрого инференса LLM

Обзор совместимости SGLang с NVIDIA, AMD и Apple. Тесты на H100/GB200, требования VRAM и практические советы по выбору железа для РФ.

SGLang: Железо для быстрого инференса LLM

SGLang (Serving LLMs with Graph) — это высокопроизводительный рантайм для инференса больших языковых моделей (LLM) и мультимодальных моделей. Проект, поддерживаемый сообществом LMSYS, позиционируется как решение для обеспечения низкой задержки и высокой пропускной способности как на одиночных GPU, так и в распределённых кластерах. В отличие от универсальных фреймворков, SGLang делает ставку на специфические оптимизации ядра, такие как RadixAttention для кэширования префиксов и дисагрегация префил/декода (PD Disaggregation). Для российских разработчиков и энтузиастов, стремящихся запустить современные модели (DeepSeek, Llama, Qwen) локально или в облаке, понимание аппаратных требований критически важно.

01Поддерживаемое железо и архитектура

Официальная документация SGLang указывает на широкую совместимость с современным аппаратным обеспечением. Ядро системы оптимизировано для следующих платформ:

  • NVIDIA GPUs: Поддержка включает флагманские решения H100, GB200, GB300, а также более доступные A100 и потребительские карты серии RTX (включая упоминание 5090 в контексте будущих/текущих бета-тестов). Также упоминается поддержка чипов Spark.
  • AMD GPUs: Активная поддержка ускорителей Instinct MI300X и MI355. SGLang предоставляет специфические оптимизации для архитектуры CDNA, что делает AMD-решения конкурентоспособной альтернативой NVIDIA в условиях ограничений на поставки.
  • Другие ускорители: Поддержка Intel Xeon CPU (для CPU-инференса или гибридных сценариев), Google TPUs (через бэкенд SGLang-Jax) и Ascend NPUs (Huawei).
  • Apple Silicon: Хотя в кратком описании README акцент сделан на серверные GPU, экосистема SGLang активно развивается для работы с M-серией (M1/M2/M3 Max/Ultra) через оптимизации памяти Unified Memory, что позволяет запускать модели среднего размера на Mac Studio.
⚠️
Важно. SGLang требует значительных объёмов VRAM для хранения KV-кэша, особенно при длинных контекстах. При использовании моделей с MLA (Multi-Head Latent Attention), таких как DeepSeek V3/R1, требования к пропускной способности памяти (memory bandwidth) становятся важнее, чем просто количество ядер. На AMD MI300X это компенсируется высокой пропускной способностью HBM3, но требует правильной настройки флагов сборки ROCm.

02Производительность и тесты

Результаты бенчмарков SGLang демонстрируют впечатляющие цифры, особенно при использовании современных архитектур NVIDIA и оптимизаций для DeepSeek. Ниже приведены ключевые данные из официальных блогов проекта:

Железо Модель / Конфигурация Метрика Примечание
NVIDIA GB300 NVL72 DeepSeek (оптимизировано) 25x ускорение По сравнению с предыдущим поколением/базовой настройкой
NVIDIA GB200 NVL72 DeepSeek (PD + Large Scale EP) 3.8x Prefill / 4.8x Decode Ускорение по сравнению с базовым запуском
96x NVIDIA H100 DeepSeek (Large Scale EP) Высокий Throughput Использование Expert Parallelism
AMD Instinct MI300X DeepSeek-R1 Конкурентоспособно Специфические оптимизации от AMD и SGLang
GLM5.2 (NVFP4) Agentic Workloads 500 TPS Достигнуто за 2 недели оптимизации

Обратите внимание: для достижения таких показателей требуется не просто одна карта, а кластеры (NVL72 — это связка из 72 GPU с высокой скоростью соединения NVLink). Для локального запуска на одной карте RTX 4090 или A100 производительность будет измеряться в десятках токенов в секунду, а не тысячах.

03Установка и сборка

SGLang распространяется через PyPI. Для установки на NVIDIA GPU требуется CUDA. Для AMD GPU необходим ROCm. Ниже приведена базовая команда установки:

terminalbash
pip install sglang[all]

Для запуска сервера инференса используется стандартная команда запуска бэкенда. Пример запуска модели Llama-3 с использованием SGLang:

terminalbash
python -m sglang.launch_server --model-path meta-llama/Llama-3-70b-instruct --host 0.0.0.0 --port 30000

При работе с моделями DeepSeek V3/R1 рекомендуется использовать специфические флаги для активации MLA (Multi-Head Latent Attention), что значительно снижает потребление памяти и повышает скорость. Для AMD карт может потребоваться установка дополнительных зависимостей через conda для корректной работы с ROCm.

💡
Совет. Если вы используете AMD Instinct MI300X, убедитесь, что ваша версия ROCm совместима с версией SGLang. В последних релизах добавлена нативная поддержка MI355, что открывает возможности для более эффективного инференса в условиях дефицита NVIDIA GPU.

04Какое железо кому подойдёт

Выбор оборудования для SGLang зависит от масштаба задач и бюджета. В условиях российского рынка, где прямые поставки новейших NVIDIA GPU ограничены, ситуация выглядит следующим образом:

1. Локальный энтузиаст / Малый бизнес (Бюджет: 100–300 тыс. руб.)

  • Железо: 1x NVIDIA RTX 4090 (24GB VRAM) или 2x RTX 3090/4090 (NVLink не обязателен, но полезен для некоторых конфигураций).
  • Модели: Llama-3-8B, Qwen-2.5-7B/14B, DeepSeek-R1-Distill-Qwen-7B/14B (квантованные до INT4/AWQ).
  • Реальность: SGLang покажет себя лучше, чем vLLM, за счёт RadixAttention. Вы получите быстрый отклик на короткие запросы. Для 70B моделей потребуется квантование до 4-бит, что снизит качество, но сделает запуск возможным.

2. Серверная разработка / Облако (Бюджет: 1–5 млн руб. / аренда)

  • Железо: NVIDIA A100 (40/80GB) или H100 (если доступно через облачных провайдеров в РФ, таких как Selectel, Yandex Cloud, VK Cloud). Альтернатива: AMD MI300X (появляются в некоторых дата-центрах).
  • Модели: Llama-3-70B, Qwen-2.5-72B, DeepSeek-V3 (в квантованном виде).
  • Реальность: A100 80GB позволяет запускать 70B модели в FP16/BF16 без сильного квантования. SGLang здесь раскрывается полностью: дисагрегация префил/декода позволяет обслуживать больше пользователей одновременно. AMD MI300X предлагает больше VRAM (192GB) за меньшие деньги, что критично для длинных контекстов.

3. Enterprise / Кластер (Бюджет: от 10 млн руб.)

  • Железо: Кластеры из 8x H100/A100 или специализированные решения на базе GB200/GB300 (через партнёров или облако).
  • Модели: DeepSeek-V3, GLM-4, большие мультимодальные модели.
  • Реальность: SGLang показывает здесь максимальную эффективность. Использование Expert Parallelism (EP) и PD Disaggregation позволяет обрабатывать тысячи запросов в секунду. Для таких задач критична скорость соединения между GPU (NVLink/NVSwitch).
⚠️
Важно. При выборе AMD GPU для SGLang в РФ, проверьте наличие технической поддержки от провайдера облачных услуг. Самостоятельная настройка ROCm на серверах с MI300X может потребовать глубоких знаний Linux и драйверов. Для NVIDIA ситуация проще, но цены на A100/H100 сильно завышены из-за параллельного импорта.

В заключение, SGLang — это мощный инструмент, который требует соответствующего железа. Для старта достаточно одной RTX 4090, но для серьёзной работы с большими моделями (70B+) лучше ориентироваться на A100/H100 или AMD MI300X в облаке. Следите за обновлениями SGLang, так как поддержка новых моделей (таких как Kimi K3, Nemotron 3 Ultra) выходит «day-0», что позволяет сразу использовать все оптимизации производительности.

Источник: источник (тест/офиц. документация) ↗