SGLang (Scheduling Graph Language) — это высокопроизводительный фреймворк инференса для больших языковых, мультимодальных и диффузионных моделей. Разработанный командой LMSYS, он оптимизирован для агентных задач, масштабного обслуживания (serving) и откатов RL (rollouts). В отличие от классических подходов, SGLang использует графовое планирование для ускорения генерации токенов, что делает выбор правильного железа критически важным для достижения максимальной пропускной способности.
01Поддерживаемое оборудование: от потребительских до серверных GPU
SGLang демонстрирует широкую совместимость с различными платформами. В таблице ниже приведены ключевые аппаратные платформы, официально поддерживаемые проектом, с акцентом на GPU, наиболее релевантные для инференса LLM в России и СНГ. | Платформа | Представительское оборудование | Примечание для РФ | | --- | --- | --- | | **NVIDIA** | H100, H200, H800, H20; A100; RTX 30/40/50 серии; RTX 6000 Ada; DGX Spark, Jetson Orin | H20 — основной доступный вариант NVIDIA в РФ. RTX 4090/3090 — бюджетный вход. | | **AMD** | Instinct MI300X, MI325X, MI350X, MI355X | Поддержка есть, но требует специфических драйверов ROCm. Доступность в РФ ограничена. | | **Apple Silicon** | Mac (M1/M2/M3/M4) через Metal/MLX | Отлично для локального тестирования малых моделей. Не подходит для продакшена. | | **Intel** | Arc / Arc Pro B-Series GPU, Xeon CPU | Поддержка XPU и CPU-инференса. Нишевое решение. | | **Huawei Ascend** | A2, A3, 950PR/DT NPUs | Растущая альтернатива в РФ, но требует специфического стека. |02Установка и запуск
SGLang предлагает два основных пути установки: через Docker (рекомендуется для изоляции и простоты) и через Python-окружение с использованием менеджераuv.
Для быстрого старта рекомендуется использовать официальный Docker-образ, который уже включает все зависимости:
docker pull lmsysorg/sglang:latestuv с флагом --prerelease=allow, так как SGLang часто обновляется:
uv pip install --prerelease=allow sglanglmsysorg/sglang:dev. Он содержит инструменты разработчика и позволяет монтировать локальную копию репозитория для тестирования изменений в режиме editable mode (pip install -e "python").03VRAM и производительность: что реально нужно
Хотя в исходном README не приведены конкретные бенчмарки "токенов в секунду" для каждой модели, логика выбора VRAM для SGLang подчиняется общим правилам инференса LLM, усиленным архитектурой SGLang. 1. **Малые модели:** * **VRAM:** Заметно меньше, чем для больших моделей. * **Железо:** Бюджетные карты начального и среднего уровня. * **Реальность в РФ:** Доступные потребительские видеокарты позволяют запускать такие модели локально. SGLang позволяет эффективно использовать память, запуская модели с большим контекстом. 2. **Средние модели:** * **VRAM:** Требуют значительного объема видеопамяти. * **Железо:** Профессиональные карты уровня RTX 6000 Ada, A100, H20. * **Реальность в РФ:** A100 и H20 доступны через облачные провайдеры (Yandex Cloud, Selectel, VK Cloud). Для локального сервера подходят RTX 6000 Ada или связка из нескольких мощных карт. SGLang эффективно использует память за счет PagedAttention и оптимизаций графа. 3. **Большие модели:** * **VRAM:** Требуют максимального объема видеопамяти. * **Железо:** H100, H200, H800, H20. * **Реальность в РФ:** H20 — основной легальный вариант NVIDIA. Требует кластерной сборки. SGLang показывает здесь максимальное преимущество за счет оптимизации межпроцессорного взаимодействия и планирования.04Альтернативы и экосистема
SGLang не ограничивается только текстом. Он интегрируется с: * **SGLang Diffusion:** Для генерации изображений и видео. * **SGLang Omni:** Для аудио (TTS, ASR). * **SpecForge:** Для спекулятивного декодирования, что ускоряет инференс на том же железе. Также проект активно развивается в сторону RL (Reinforcement Learning) и пост-обучения, интегрируясь с фреймворками вродеverl и Miles. Это делает SGLang не просто рантаймом, а частью полного цикла разработки AI-агентов.
05Какое железо кому подойдёт
Выбор зависит от вашего бюджета и задач: 1. **Бюджетный энтузиаст / Локальный тест:** * **Железо:** Mac Studio (M2/M3 Max) или ПК с RTX 4090. * **Почему:** Apple Silicon отлично работает через Metal/MLX. RTX 4090 дает максимальную плотность вычислений на рубль для инференса. SGLang запускается легко через Docker. 2. **Стартап / Малый продакшен:** * **Железо:** Аренда A100/H20 в облаке РФ или локальный сервер с RTX 6000 Ada. * **Почему:** A100/H20 обеспечивают стабильную пропускную способность для нескольких пользоватеИсточник: источник (тест/офиц. документация) ↗