Главная/Блог/Гайд/SGLang: Какое железо нужно для быстрого…
Гайд4 мин чтения · 5 августа 2026 г.

SGLang: Какое железо нужно для быстрого инференса LLM

Разбираем требования SGLang к GPU: от NVIDIA H100 до AMD MI300X. Установка, поддержка моделей и выбор железа для РФ.

SGLang (Serving Language Models) позиционируется как высокопроизводительный движок для инференса больших языковых моделей (LLM) и мультимодальных систем. Проект, поддерживаемый сообществом LMSYS, обрабатывает триллионы токенов ежедневно и используется более чем 400 000 GPU. Ключевая особенность SGLang — архитектура RadixAttention для кэширования префиксов, распараллеливание тензоров/пайплайнов/экспертов и поддержка специфичных оптимизаций для современных архитектур (DeepSeek, Kimi, GLM). В этой статье разберем, какое железо реально нужно для запуска SGLang, как его установить и какие модели поддерживаются.

01Поддерживаемое железо и производительность

SGLang демонстрирует широкую совместимость с аппаратным обеспечением. В официальной документации и блогах проекта упоминаются следующие платформы:

  • NVIDIA: GB200, B300, H100, A100, Spark, RTX 5090.
  • AMD: Instinct MI355, MI300X.
  • Другие: Intel Xeon (CPU), Google TPUs, Ascend NPUs.

Производительность сильно зависит от масштаба развертывания. Например, для модели DeepSeek-R1 на кластере из 96 GPU H100 с использованием дисагрегации префила/декода (PD) и крупномасштабного параллелизма экспертов (EP), достигается значительный прирост пропускной способности. На NVIDIA GB200 NVL72 зафиксировано ускорение инференса в 25 раз по сравнению с базовыми настройками. Для AMD Instinct MI300X также опубликованы результаты разблокировки производительности DeepSeek-R1 и DeepSeek-V3 с использованием специфичных оптимизаций SGLang.

⚠️
Важно. SGLang активно поддерживает квантование (FP4, FP8, INT4, AWQ, GPTQ). Это критически важно для экономии VRAM. Например, запуск GLM5.2 в формате NVFP4 позволяет достичь 500 TPS (токенов в секунду) на ограниченных ресурсах, что делает возможным инференс сложных агентов на меньшем количестве GPU.

02Установка и запуск

Установка SGLang осуществляется через pip. Для работы требуется актуальная версия Python и CUDA (для NVIDIA) или ROCm (для AMD). Ниже приведена базовая команда установки:

terminalbash
pip install sglang[all]

Для запуска сервера инференса используется стандартная команда запуска с указанием модели и порта. Пример для локального запуска на одной GPU:

terminalbash
python -m sglang.launch_server --model-path lmsys/vicuna-7b-v1.5 --port 30000

Для распределенных кластеров (например, на H100 или A100) необходимо использовать флаги для tensor parallelism (tp) и специфичные хосты. SGLang также поддерживает запуск на TPU через бэкенд SGLang-Jax, что открывает возможности для работы в Google Cloud.

03Поддержка моделей

SGLang предоставляет "day-0" поддержку для многих новых моделей, что означает немедленную оптимизацию после их выхода. Среди поддерживаемых:

  • LLM: Llama, Qwen, DeepSeek (V3, V4, R1, R1.5), Kimi (K3), GLM (GLM5.2), GPT, Gemma, Mistral.
  • Мультимодальные: LLaVA-OneVision, Nemotron 3 Ultra/Super/Nano.
  • Диффузионные модели: WAN, Qwen-Image, Higgs Audio v3 (TTS).

Особое внимание уделено оптимизациям для DeepSeek. SGLang поддерживает специфичные для DeepSeek механизмы, такие как MLA (Multi-head Latent Attention), что позволяет ускорить инференс в 7 раз по сравнению с предыдущими версиями. Также добавлена поддержка OpenAI gpt-oss модели.

💡
Совет. Если вы используете AMD MI300X, убедитесь, что используете последние версии ROCm и SGLang. Проект активно сотрудничает с AMD, и для этих GPU доступны специфичные оптимизации, такие как Wave и MoRI, которые значительно повышают эффективность.

04Какое железо кому подойдёт

Выбор железа для SGLang зависит от бюджета и задач. Вот честные рекомендации для рынка РФ:

1. Стартапы и небольшие команды (Бюджет: 500 тыс. – 2 млн руб.)

Железо: 2-4x NVIDIA RTX 4090 (24GB VRAM) или RTX 5090 (если доступны). Альтернатива: аренда GPU в облаках (Yandex Cloud, Selectel).

Модели: Llama-3-8B, Qwen-2.5-7B, DeepSeek-R1-Distill-Qwen-7B (в квантованном виде INT4/AWQ).

Производительность: Высокая скорость генерации для небольших моделей. Для DeepSeek-V3 потребуется квантование FP8/INT4 и, возможно, 8x RTX 4090 для комфортной работы.

2. Средний бизнес и хостинг (Бюджет: 5 – 15 млн руб.)

Железо: NVIDIA A100 (40GB/80GB) или H100 (если есть доступ через партнеров). В РФ H100 купить сложно, но можно арендовать. A100 более доступны на вторичном рынке.

Модели: DeepSeek-V3, Llama-3-70B, Qwen-2.5-72B.

Производительность: A100 80GB позволяет запускать 70B модели в FP16 с небольшим кэшированием. H100 обеспечивает максимальную пропускную способность для тяжелых нагрузок.

3. Enterprise и крупные проекты (Бюджет: от 20 млн руб. и выше)

Железо: Кластеры из NVIDIA H100/H200 или AMD MI300X. В РФ H20 является легальной альтернативой H100, но с урезанной межпроцессорной связью. Для SGLang важна скорость NVLink, поэтому H20 может уступать H100 в распределенных задачах.

Модели: DeepSeek-V4, Kimi K3, GLM5.2, большие мультимодальные модели.

Производительность: Использование PD-дисагрегации и EP-параллелизма позволяет обрабатывать тысячи запросов в секунду. Для AMD MI300X требуется настройка ROCm, но производительность сопоставима с NVIDIA при правильной оптимизации.

⚠️
Важно. В России покупка новейших NVIDIA H100/H200 ограничена санкциями. Альтернативы: NVIDIA H20 (легально, но медленнее в межсоединениях), AMD MI300X (доступны через партнеров, требуют настройки ROCm), или аренда GPU в облаках. Для SGLang критична скорость обмена между GPU, поэтому кластеры на H20 могут требовать больше узлов для той же производительности, что и на H100.

SGLang — это мощный инструмент, который позволяет извлекать максимум из доступного железа. Выбор между NVIDIA и AMD зависит от доступности и готовности к настройке. Для большинства задач в РФ оптимальным стартом будет использование RTX 4090/5090 для легких моделей или аренда A100/H200 для тяжелых LLM.

Источник: источник (тест/офиц. документация) ↗