Главная/Блог/Гайд/SGLang на GPU: выбор железа, установка…
Гайд4 мин чтения · 10 октября 2026 г.

SGLang на GPU: выбор железа, установка и производительность

Разбираем, на каком оборудовании запускать SGLang для инференса LLM. От RTX 4090 до H100: совместимость, установка и практические советы.

SGLang (Scheduling Graph Language) — это высокопроизводительный фреймворк инференса для больших языковых, мультимодальных и диффузионных моделей. Разработанный командой LMSYS, он оптимизирован для агентных задач, масштабного обслуживания (serving) и откатов RL (rollouts). В отличие от классических подходов, SGLang использует графовое планирование для ускорения генерации токенов, что делает выбор правильного железа критически важным для достижения максимальной пропускной способности.

01Поддерживаемое оборудование: от потребительских до серверных GPU

SGLang демонстрирует широкую совместимость с различными платформами. В таблице ниже приведены ключевые аппаратные платформы, официально поддерживаемые проектом, с акцентом на GPU, наиболее релевантные для инференса LLM в России и СНГ. | Платформа | Представительское оборудование | Примечание для РФ | | --- | --- | --- | | **NVIDIA** | H100, H200, H800, H20; A100; RTX 30/40/50 серии; RTX 6000 Ada; DGX Spark, Jetson Orin | H20 — основной доступный вариант NVIDIA в РФ. RTX 4090/3090 — бюджетный вход. | | **AMD** | Instinct MI300X, MI325X, MI350X, MI355X | Поддержка есть, но требует специфических драйверов ROCm. Доступность в РФ ограничена. | | **Apple Silicon** | Mac (M1/M2/M3/M4) через Metal/MLX | Отлично для локального тестирования малых моделей. Не подходит для продакшена. | | **Intel** | Arc / Arc Pro B-Series GPU, Xeon CPU | Поддержка XPU и CPU-инференса. Нишевое решение. | | **Huawei Ascend** | A2, A3, 950PR/DT NPUs | Растущая альтернатива в РФ, но требует специфического стека. |
⚠️
Важно. При выборе NVIDIA GPU обратите внимание на поколение. SGLang активно оптимизирован под архитектуры Ada Lovelace (RTX 40xx) и Hopper (H100/H200). Старые карты (например, GTX 10xx или даже RTX 20xx) могут работать, но не получат полного прироста производительности от новых алгоритмов планирования.

02Установка и запуск

SGLang предлагает два основных пути установки: через Docker (рекомендуется для изоляции и простоты) и через Python-окружение с использованием менеджера uv. Для быстрого старта рекомендуется использовать официальный Docker-образ, который уже включает все зависимости:
terminalbash
docker pull lmsysorg/sglang:latest
Если вы предпочитаете установку в активированное Python-окружение, используйте uv с флагом --prerelease=allow, так как SGLang часто обновляется:
terminalbash
uv pip install --prerelease=allow sglang
После установки необходимо запустить модель. Конкретная команда зависит от выбранного железа и модели, поэтому рекомендуется обращаться к разделу Cookbook проекта, где собраны готовые команды для различных конфигураций.
💡
Совет. Для разработки и отладки используйте образ lmsysorg/sglang:dev. Он содержит инструменты разработчика и позволяет монтировать локальную копию репозитория для тестирования изменений в режиме editable mode (pip install -e "python").

03VRAM и производительность: что реально нужно

Хотя в исходном README не приведены конкретные бенчмарки "токенов в секунду" для каждой модели, логика выбора VRAM для SGLang подчиняется общим правилам инференса LLM, усиленным архитектурой SGLang. 1. **Малые модели:** * **VRAM:** Заметно меньше, чем для больших моделей. * **Железо:** Бюджетные карты начального и среднего уровня. * **Реальность в РФ:** Доступные потребительские видеокарты позволяют запускать такие модели локально. SGLang позволяет эффективно использовать память, запуская модели с большим контекстом. 2. **Средние модели:** * **VRAM:** Требуют значительного объема видеопамяти. * **Железо:** Профессиональные карты уровня RTX 6000 Ada, A100, H20. * **Реальность в РФ:** A100 и H20 доступны через облачные провайдеры (Yandex Cloud, Selectel, VK Cloud). Для локального сервера подходят RTX 6000 Ada или связка из нескольких мощных карт. SGLang эффективно использует память за счет PagedAttention и оптимизаций графа. 3. **Большие модели:** * **VRAM:** Требуют максимального объема видеопамяти. * **Железо:** H100, H200, H800, H20. * **Реальность в РФ:** H20 — основной легальный вариант NVIDIA. Требует кластерной сборки. SGLang показывает здесь максимальное преимущество за счет оптимизации межпроцессорного взаимодействия и планирования.
⚠️
Важно. SGLang поддерживает мультимодальные модели и диффузию. Запуск изображений/видео требует дополнительных ресурсов VRAM. Убедитесь, что ваша карта имеет запас памяти для загрузки весов мультимодального энкодера.

04Альтернативы и экосистема

SGLang не ограничивается только текстом. Он интегрируется с: * **SGLang Diffusion:** Для генерации изображений и видео. * **SGLang Omni:** Для аудио (TTS, ASR). * **SpecForge:** Для спекулятивного декодирования, что ускоряет инференс на том же железе. Также проект активно развивается в сторону RL (Reinforcement Learning) и пост-обучения, интегрируясь с фреймворками вроде verl и Miles. Это делает SGLang не просто рантаймом, а частью полного цикла разработки AI-агентов.

05Какое железо кому подойдёт

Выбор зависит от вашего бюджета и задач: 1. **Бюджетный энтузиаст / Локальный тест:** * **Железо:** Mac Studio (M2/M3 Max) или ПК с RTX 4090. * **Почему:** Apple Silicon отлично работает через Metal/MLX. RTX 4090 дает максимальную плотность вычислений на рубль для инференса. SGLang запускается легко через Docker. 2. **Стартап / Малый продакшен:** * **Железо:** Аренда A100/H20 в облаке РФ или локальный сервер с RTX 6000 Ada. * **Почему:** A100/H20 обеспечивают стабильную пропускную способность для нескольких пользовате

Источник: источник (тест/офиц. документация) ↗