SGLang (Serving Language Models) позиционируется как высокопроизводительный рантайм для инференса больших языковых моделей. В отличие от классических решений, он делает ставку на RadixAttention для кэширования префиксов, распараллеливание экспертных параллелизмов (EP) и поддержку современных архитектур, таких как DeepSeek и Kimi. Для разработчиков в РФ и СНГ вопрос выбора железа стоит остро: от доступных потребительских карт до серверных решений. Разберем, что нужно для запуска SGLang, как его установить и какое железо выбрать под разные задачи.
01Поддерживаемое железо и VRAM
Согласно официальной документации SGLang, фреймворк поддерживает широкий спектр аппаратных платформ. Ключевые акценты сделаны на NVIDIA и AMD, но есть и поддержка Intel CPU, Google TPU и Ascend NPU.
Ключевые GPU для SGLang:
- NVIDIA: GB200, B300, H100, A100, Spark, RTX 5090. Поддержка новейших чипов (GB200/B300) позволяет достигать рекордной пропускной способности при использовании специализированных оптимизаций (например, заметное ускорение декодирования на GB200 NVL72).
- AMD: Instinct MI355, MI300. SGLang предоставляет day-0 поддержку для AMD, что критично для обхода ограничений на поставки NVIDIA. Тесты показывают высокую эффективность с моделями DeepSeek-R1/V3.
- Apple: В списке прямого упоминания M-серии нет, но SGLang ориентирован на Linux/Windows серверные среды. Для Mac обычно используют другие рантаймы (например, llama.cpp), хотя экосистема расширяется.
02Установка и запуск
Установка SGLang стандартна для Python-экосистемы. Рекомендуется использовать актуальную версию PyPI. Для работы с AMD GPU потребуется настройка ROCm, для NVIDIA — CUDA.
pip install sglang[all]Для запуска сервера инференса используется команда python -m sglang.launch_server. Флаги конфигурации включают:
--model-path: путь к модели (Hugging Face или локальный).--hostи--port: адрес и порт API.--tp(tensor parallel): количество GPU для параллельного запуска (актуально для A100/H100/MI300).--quantization: тип квантования (fp8, int4, awq и др.).
Пример запуска локально на одной GPU (например, RTX 4090/5090 или A100 80GB):
python -m sglang.launch_server \
--model-path meta-llama/Llama-3.1-8B-Instruct \
--host 0.0.0.0 \
--port 3000003Производительность и реальные сценарии
SGLang демонстрирует выдающиеся результаты в сравнении с vLLM и TensorRT-LLM, особенно в сценариях с длинными контекстами и сложными структурами (DeepSeek, MoE-архитектуры). Ниже приведена сводка данных из источников по производительности на различных платформах.
| Железо | Модель / Конфигурация | Метрика | Примечание |
|---|---|---|---|
| NVIDIA GB200 NVL72 | DeepSeek (Large Scale EP) | Заметное ускорение | Ускорение декодирования по сравнению с предыдущими поколениями (H100) при использовании PD Disaggregation. |
| NVIDIA GB300 NVL72 | DeepSeek (Speculative Decoding) | 25x Inference Performance | Использование next-gen speculative decoding (DFlash/Spec V2). |
| AMD Instinct MI300X | DeepSeek-R1 / V3 | High Throughput | Day-0 поддержка. Оптимизации для Sparse Attention и MLA. |
| 96x NVIDIA H100 | DeepSeek (Large Scale EP) | Масштабируемость | Успешный деплой с Expert Parallelism. Точные токены/с зависят от модели, но подтверждена стабильность кластера. |
| NVIDIA (General) | GLM5.2 (NVFP4) | 500 TPS | Agentic workloads. Быстрый старт (2 недели на оптимизацию). |
04Какое железо кому подойдёт
Выбор оборудования зависит от бюджета и задач. В условиях РФ важно учитывать доступность и стоимость аренды/покупки.
1. Стартап / MVP / Тестирование (Бюджет: Низкий)
- Железо: 1x NVIDIA RTX 4090 (24GB VRAM) или 1x RTX 5090 (если доступна).
- Модели: Llama-3.1-8B, Qwen-2.5-7B, Mistral-7B (в квантовании INT4/FP8).
- Почему: SGLang отлично работает на одном GPU. 24GB VRAM позволяют запустить 7B-модели с большим контекстом. RTX 5090 обещает значительный прирост скорости.
- Где взять: Купить в РФ (через параллельный импорт), арендовать на Vast.ai или Yandex Cloud (если есть GPU 4090/5090 в пулах).
2. Средний бизнес / Промышленный инференс (Бюджет: Средний)
- Железо: 2-4x NVIDIA A100 (40/80GB) или 2x AMD MI300X (192GB VRAM).
- Модели: Llama-3.1-70B, Qwen-2.5-32B/72B, DeepS
Источник: источник (тест/офиц. документация) ↗