mit-han-lab/qserve

[MLSys'25] QServe: квантование W4A8KV4 и системная совместная разработка для эффективного обслуживания LLM; [MLSys'25] LServe: эффективное обслуживание длинных последовательностей LLM с унифицированным разреженным вниманием

Инференс⭐ 861C++
Открыть на GitHub ↗

Что это за инструмент

OmniServe — это унифицированный движок для инференса больших языковых моделей (LLM), объединяющий технологии квантования QServe и оптимизации длинных контекстов LServe.

Зачем нужен

Инструмент решает две ключевые проблемы: снижение вычислительной сложности за счет квантования W4A8KV4 и ускорение обработки длинных последовательностей через унифицированное разреженное внимание. Это позволяет значительно повысить пропускную способность GPU и сократить инфраструктурные затраты при развертывании LLM.

Что можно реализовать

  • Развертывание LLM с высокой пропускной способностью для обслуживания большого числа запросов (large-batch).
  • Обработка документов с очень длинным контекстом (long-context) без потери производительности.
  • Снижение стоимости инфраструктуры за счет эффективного использования памяти и вычислений GPU.
  • Использование готовых оптимизаций, уже интегрированных в NVIDIA TensorRT-LLM.

Ключевые возможности

  • Квантование W4A8KV4 с минимизацией накладных расходов на деквантование.
  • Унифицированное разреженное внимание (Unified Sparse Attention) для ускорения префиллинга и декодирования.
  • Иерархическое управление KV-кэшем для эффективной работы с длинными последовательностями.
  • Поддержка как текстовых LLM, так и мультимодальных языковых моделей (VLM).
  • Гибкая настройка точности квантования и паттернов разреженного внимания.

👤 Кому подойдёт: Инженеры по машинному обучению (MLE), разработчики систем инференса LLM, исследователи в области оптимизации нейросетей.

Релизы

Релизы ещё не отслежены — появятся после ближайшего опроса.