ModelTC/lightllm

LightLLM — это легковесный, масштабируемый и высокопроизводительный фреймворк для инференса и обслуживания LLM на Python.

Инференс⭐ 4 295Pythonпоследний релиз: v1.2.0
Открыть на GitHub ↗

Что это за инструмент

LightLLM — это легковесный фреймворк на Python для инференса и обслуживания больших языковых моделей (LLM), сочетающий высокую скорость работы с простотой развертывания.

Зачем нужен

Инструмент решает задачу эффективного запуска LLM-серверов, обеспечивая высокую пропускную способность и низкие задержки за счет оптимизаций, заимствованных из FasterTransformer, vLLM и FlashAttention. Он полезен для тех, кому нужен быстрый и масштабируемый способ предоставления доступа к моделям (serving) без избыточной сложности.

Что можно реализовать

  • Развертывание высоконагруженных LLM-серверов с гарантиями SLA (использование Past-Future Scheduler)
  • Детерминированная генерация структурированного текста (constrained decoding) с использованием Pre^3
  • Исследование и прототипирование новых методов управления KV Cache благодаря чистому Python-дизайну
  • Масштабирование инференса на кластерах с поддержкой передачи Prefix KV Cache между рангами (DP)

Ключевые возможности

  • Высокая производительность: заявлена самая быстрая работа с DeepSeek-R1 на одном GPU H200
  • Легковесность и чистота кода: Python-based дизайн упрощает интеграцию и изучение внутренних механизмов
  • Продвинутые алгоритмы: поддержка структурированного вывода (ACL2025) и планировщиков с гарантиями SLA (ASPLOS’25)
  • Широкое признание в индустрии: ядро LightLLM используется в vLLM, SGLang и Aphrodite
  • Активная разработка: регулярные релизы (v1.1.0) и поддержка новых архитектур (например, Pre^3)

👤 Кому подойдёт: Инженеры по машинному обучению (MLE), разработчики LLM-сервисов, исследователи в области систем инференса и архитекторы, ищущие высокопроизводительные решения для развертывания LLM.

Релизы

v1.2.0major
🕐 1 мес назад · релиз на GitHub ↗

LightLLM v1.2.0: RL-сервинг через verl, дисагрегированный ViT, гибридный кэш для линейного внимания и многоуровневая кэшизация.

  • Added: Поддержка RL-сервинга: LightLLM стал бэкендом для verl с онлайн-обновлением весов, управлением кэшем и GPU-памятью.
  • Added: Дисагрегированный ViT: визуальное кодирование вынесено в отдельный сервис с прокси-режимом и кэшем на AFS/Redis.
  • Added: Гибридный Radix Cache: двухуровневая система (большие и малые страницы) для эффективного кэширования моделей с линейным вниманием.
  • Added: Многоуровневый кэш и PD: поддержка GPU/CPU/disk, квантованных форматов KV, NUMA-aware размещения и cache-aware планирования.
  • Fixed: Исправления: баги FP8 для MoE, загрузка весов Mixtral, предупреждения Triton, оптимизация выделения памяти MTP и стабильность планировщика.