Главная/Блог/Гайд/SGLang на GPU: Тесты, VRAM и выбор…
Гайд5 мин чтения · 11 августа 2026 г.

SGLang на GPU: Тесты, VRAM и выбор железа для инференса LLM

Разбираем производительность SGLang на NVIDIA H100, AMD MI300X и Apple M-серии. Реальные цифры TPS, требования к VRAM и советы по выбору железа для РФ.

SGLang на GPU: Тесты, VRAM и выбор железа для инференса LLM

SGLang (Serving LLMs with Graph) — это высокопроизводительный движок инференса, который за последние годы стал стандартом де-факто для запуска больших языковых моделей (LLM). В отличие от классических решений, SGLang делает ставку на RadixAttention для кэширования префиксов, распараллеливание экспертов (EP) и поддержку специфичных оптимизаций для современных архитектур, таких как DeepSeek и Kimi. Но какое железо реально нужно, чтобы увидеть заявленные цифры скорости?

01Производительность и железо: что показывает практика

В источнике приведены конкретные кейсы масштабирования. Ключевым показателем здесь выступает не просто токенов в секунду (tok/s) на одной карте, а пропускная способность кластера (TPS — tokens per second) при распределенном запуске. SGLang демонстрирует выдающиеся результаты на гибридных архитектурах с большим количеством GPU.

Наиболее впечатляющие данные связаны с использованием NVIDIA GB200 NVL72 и GB300. Например, развёртывание DeepSeek на 96 GPU H100 с использованием Parallel Disaggregation (PD) и Large-Scale Expert Parallelism (EP) показало рост пропускной способности декодирования в 2.7–4.8 раза по сравнению с базовыми настройками. А на новейшем чипе GB300 NVL72 удалось разблокировать ускорение инференса в 25 раз.

Для AMD ситуация также благоприятна. Запуски DeepSeek-R1 на AMD Instinct MI300X показывают конкурентоспособные результаты, особенно с учетом того, что SGLang предоставляет day-0 поддержку для этих чипов. Это критически важно, так как AMD активно захватывает долю рынка в сегменте AI-инференса.

Железо (GPU) Модель / Конфигурация Метрика / Результат Примечание по VRAM/Архитектуре
NVIDIA H100 (96 шт.) DeepSeek (Large-Scale EP) 4.8x рост Decode Throughput Требует NVLink высокого уровня для связи
NVIDIA GB300 NVL72 DeepSeek / General LLM 25x ускорение инференса Новейшая архитектура, максимальная производительность
AMD Instinct MI300X DeepSeek-R1 Высокая пропускная способность Поддержка через ROCm, оптимизации SGLang
NVIDIA A100 Различные LLM Стабильный инференс Базовый уровень для enterprise-развертываний

02Установка и совместимость: NVIDIA, AMD и Apple

SGLang поддерживает широкий спектр аппаратных платформ. Для NVIDIA требуется CUDA. Для AMD — ROCm. Также есть экспериментальная поддержка Google TPUs (через SGLang-Jax) и Apple Silicon (M-серия), хотя последние в источнике упоминаются скорее как часть экосистемы «Broad Hardware Support», а не как лидеры по скорости инференса для тяжелых моделей.

Важно отметить поддержку квантования: SGLang работает с FP4, FP8, INT4, AWQ и GPTQ. Это позволяет запускать модели, которые не помещаются в VRAM в полном精度, или значительно ускорять инференс за счет снижения требований к пропускной способности памяти.

terminalbash
# Пример установки SGLang для NVIDIA GPU
pip install sglang[all]

# Для AMD Instinct (MI300X/MI355) требуется настройка ROCm
# Убедитесь, что версия ROCm совместима с вашей версией PyTorch
pip install sglang[all] --extra-index-url https://download.pytorch.org/whl/rocm6.0
⚠️
Важно. При использовании AMD Instinct MI300X убедитесь, что ваша версия ROCm и PyTorch строго совместимы. SGLang активно развивает поддержку AMD, но ошибки в версиях библиотек могут привести к краху при инициализации модели. Всегда проверяйте документацию для конкретной версии SGLang.

03VRAM: сколько нужно под разные модели

Объем видеопамяти — главный ограничитель. SGLang использует PagedAttention, что эффективно управляет памятью, но базовые требования остаются:

  • 7B-13B модели (Llama 3, Qwen 2.5): Достаточно одной GPU с 24 ГБ VRAM (RTX 3090/4090) для INT4/AWQ. В FP16 потребуется 2x RTX 3090 или одна A100 80GB.
  • 32B-70B модели (DeepSeek V3, Llama 3.1 70B): Требуются мульти-GPU конфигурации. Для 70B в FP16 нужно ~140 ГБ VRAM, что означает 2x A100 80GB или 4x RTX 4090 (с осторожностью из-за PCIe). SGLang позволяет эффективно распределять нагрузку через Tensor Parallelism.
  • Модели с MoE (Mixture of Experts): Такие как DeepSeek V3/R1. SGLang оптимизирован для Expert Parallelism. На AMD MI300X это особенно эффективно благодаря высокой пропускной способности памяти HBM3.
💡
Совет. Если вы планируете запускать модели типа DeepSeek V3, обратите внимание на поддержку FP4. SGLang позволяет использовать квантование FP4, что сокращает требования к VRAM в 2 раза по сравнению с FP8/FP16, не теряя критически много в качестве. Это делает возможным запуск больших MoE-моделей на меньшем количестве GPU.

04Реальность рынка РФ: что купить и арендовать

В условиях санкций прямые поставки NVIDIA H100/A100 в РФ затруднены. Однако SGLang поддерживает AMD Instinct MI300X, которые также сложно достать, но есть альтернативы. Для локальных развертываний часто используют NVIDIA RTX 4090 (24GB) или б/у A100/A6000. SGLang отлично работает на RTX 4090 благодаря поддержке CUDA 12.x и оптимизациям torch.compile.

Для облачных вычислений в РФ популярны сервисы, предоставляющие доступ к A100 и V100. SGLang совместим с ними, но для максимальной производительности на DeepSeek рекомендуется искать провайдеров с AMD MI300X или NVIDIA H100, так как именно под эти чипы сделан основной упор в последних оптимизациях (Day-0 support).

05Какое железо кому подойдёт

  • Энтузиасты / Small Team (Бюджет до 300 тыс. руб.): 2-4x NVIDIA RTX 4090. SGLang позволит запускать модели до 32B параметров в квантованном виде. Идеально для тестирования и небольших сервисов.
  • Enterprise / Production (Бюджет от 1 млн руб.): Аренда или покупка кластеров на NVIDIA A100 80GB или AMD Instinct MI300X. Для моделей типа DeepSeek V3/R1 или Kimi K3 необходимо масштабное распараллеливание (EP/PD). Здесь SGLang раскрывает свой потенциал, показывая 2.7x-4.8x прирост производительности.
  • Research / MLops: Использование Google TPUs через SGLang-Jax. Это нишевое решение, но оно дает доступ к высокопроизводительным TPU v4/v5p для экспериментов без привязки к NVIDIA.

SGLang — это не просто еще один рантайм, а инструмент, который адаптируется под железо. Если у вас есть AMD MI300X, не игнорируйте SGLang — там есть специфичные оптимизации, которых нет в vLLM. Если у вас NVIDIA, выбирайте SGLang для работы с новыми архитектурами (DeepSeek, Kimi) и квантованием FP4/FP8.

Источник: источник (тест/офиц. документация) ↗