sgl-project/sglang

SGLang is a high-performance serving framework for large language models and multimodal models.

Инференс⭐ 36 231Pythonпоследний релиз: v0.5.20
Открыть на GitHub ↗Сайт проекта ↗

Что это за инструмент

SGLang — это высокопроизводительный фреймворк для развертывания и обслуживания (serving) больших языковых моделей (LLM) и мультимодальных моделей.

Зачем нужен

Инструмент решает задачу обеспечения высокой скорости генерации токенов и эффективного использования GPU при обработке запросов. Он полезен для снижения задержек и увеличения пропускной способности при работе с современными архитектурами, такими как MoE и Diffusion LLM.

Что можно реализовать

  • Развертывание LLM с поддержкой speculative decoding (DFlash, Spec V2) для ускорения инференса
  • Обработка мультимодальных задач, включая генерацию видео и изображений через SGLang Diffusion
  • Масштабирование моделей на кластерах GPU (NVIDIA GB200, AMD Instinct) с использованием Expert Parallelism
  • Запуск моделей на TPU с использованием бэкенда SGLang-Jax
  • Обеспечение быстрой поддержки новых open-source моделей (Day-0 support) сразу после их выхода

Ключевые возможности

  • Поддержка передовых методов ускорения инференса, таких как speculative decoding
  • Нативная работа с мультимодальными моделями и diffusion-архитектурами
  • Оптимизация для специфического оборудования (NVIDIA, AMD, TPU)
  • Интеграция в экосистему PyTorch
  • Высокая пропускная способность (throughput) на крупных кластерах GPU

👤 Кому подойдёт: ML-инженеры, разработчики AI-инфраструктуры, исследователи, работающие с LLM и мультимодальными моделями

Релизы

v0.5.20majorbreaking
🕐 2 дн назад · релиз на GitHub ↗

Поддержка новых моделей, оптимизация загрузки на ROCm, симулятор и отключение хранения ответов по умолчанию.

  • Added: Добавлена поддержка моделей GLM-5.3-Flash, Qwen3.8-Flash-Next, K2 Horizon, Nanbeige4.2, SenseNova-U1.5-8B-MoT, FastH3 и VDN-H3.
  • Added: Введены маски выборки для RL-роллаутов с повышением пропускной способности до 52% и оптимизированная загрузка моделей на ROCm.
  • Added: Реализован единый радиусный кэш для SWA, поддержка DSpark в PD-режиме с контекстным параллелизмом и CPU-симулятор планировщика.
  • Added: Добавлены официальные Docker-образы для Intel XPU и поддержка DisallowedTokensLogitsProcessor вместе с масками выборки.
  • Breaking: Хранение ответов API отключено по умолчанию; удалена устаревшая стратегия Prefill context parallelism v1.
v0.5.19major
🕐 16 дн назад · релиз на GitHub ↗

SGLang v0.5.19: поддержка beam search, DeepEP v2, оптимизации для Hopper/Blackwell и новые модели Qwen3.8, Granite 4.2.

  • Added: Добавлена поддержка beam search: передавайте beam_width для получения n лучших последовательностей.
  • Added: DeepEP v2 с ElasticBuffer для DeepSeek-V3/V4 и Qwen3-MoE в FP8, позволяющий запускать decode в CUDA graphs.
  • Added: Оптимизации для Hopper: W4A8 MoE с активациями FP8 (до +12% пропускной способности) и LayerNorm sequence parallelism.
  • Added: Decode context parallelism (DCP) теперь работает по умолчанию на бэкенде Blackwell MLA (trtllm_mla).
  • Added: Добавлена поддержка новых моделей: Qwen3.8 (2.4T-A95B), Qwen3.8-27B, Granite 4.2, LongCat-Image-Edit и других.
v0.5.18majorbreaking
🕐 1 мес назад · релиз на GitHub ↗

Добавлена поддержка новых моделей, оптимизирован запуск чекпоинтов и LMHead, объединены кэши компиляции.

  • Added: Добавлена поддержка Muse Glimmer, Intern-S2-Mobius, SANA-Video, LTX-2.5, Cosmos3 и других моделей.
  • Added: Реализован overlapped checkpoint staging: загрузка чекпоинтов параллельно с захватом CUDA-графов ускоряет старт.
  • Added: Оптимизирован TP LMHead через All-to-All, что снижает задержку декодирования и улучшает TPOT.
  • Added: FlashInfer MNNVL переиспользуется для allreduce, повышая производительность на малых батчах.
  • Breaking: Все кэши компиляции (Triton, FlashInfer, Inductor) теперь хранятся в SGLANG_CACHE_DIR, требуется перекомпиляция.
v0.5.17major
🕐 1 мес назад · релиз на GitHub ↗

SGLang v0.5.17: поддержка Kimi K3 и MiniMax-H3, Rust-фронтенд, DWDP для MoE и оптимизация восстановления движка.

  • Added: Добавлена нативная поддержка моделей Kimi K3 (LatentMoE) и MiniMax-H3 (видеогенерация с аудио) с первого дня.
  • Added: Реализован начальный этап миграции фронтенда с Python на многопоточный Rust для обработки сетевых запросов.
  • Added: Внедрена стратегия параллелизма DWDP для префилла MoE, исключающая all-to-all диспетчеризацию токенов.
  • Added: Добавлен Unified Radix Cache с учетом сессий для агентов и RL-роллаутов, позволяющий управлять инвалидацией префиксов.
  • Added: Оптимизировано восстановление движка через демон кэширования весов и улучшена работа с DCP-бэкендами коммуникации.
v0.5.16majorbreaking
🕐 1 мес назад · релиз на GitHub ↗

Добавлена поддержка Inkling и DSpark, UnifiedRadixTree стал дефолтом, удалены устаревшие бэкенды квантования.

  • Added: Добавлена поддержка модели Inkling (975B MoE) и алгоритма спекулятивного декодирования DSpark.
  • Added: UnifiedRadixTree стал алгоритмом по умолчанию для моделей с SWA, Mamba и DSA.
  • Added: Оптимизировано распределение KV-кэша GLM-5.2 при чанк-параллелизме, снижено потребление памяти на ~74%.
  • Added: Внедрен ReplaySSM Ring Spec-Verify, сокративший объем спекулятивного скретч-памяти в 6.4 раза.
  • Added: Добавлена поддержка линейного внимания на Blackwell (SM100) и новые модели: LongCat 2.0, Pi0.5.
  • Breaking: Удалены экспериментальные пути квантования QServe, FBGEMM FP8 и бэкенд CUTLASS для NVFP4.
v0.5.14major
🕐 2 мес назад · релиз на GitHub ↗

Поддержка GLM-5.2, DeepSeek-V4 на GB300, оптимизации MoE и KDA, интеграция MSCCL++ и AMD ROCm.

  • Added: Добавлена поддержка моделей GLM-5.2, LiquidAI LFM2.5, Kimi-K2.7-Code, Poolside Laguna-M.1, DiffusionGemma, Zyphra ZAYA1 и MiMo-V2-ASR.
  • Added: DeepSeek-V4 на NVIDIA GB300: в 5 раз выше пропускная способность при той же интерактивности с первого дня.
  • Added: Новые методы балансировки нагрузки для DeepEP: Waterfill для общих экспертов и LPLB (LP) для избыточных реплик.
  • Added: KDA CuteDSL prefill kernel на Blackwell (SM100): ускорение на 1.08–1.52x по сравнению с Triton.
  • Added: Экономия памяти prefix-cache для KDA/GDN через int8 пул чекпоинтов и дедупликацию оконного кэша.
  • Added: Интеграция MSCCL++, поддержка NVFP4 MoE для DeepSeek-V4, оптимизации decode и работа CUDA graph на AMD ROCm.