mit-han-lab/qserve
[MLSys'25] QServe: квантование W4A8KV4 и системная совместная разработка для эффективного обслуживания LLM; [MLSys'25] LServe: эффективное обслуживание длинных последовательностей LLM с унифицированным разреженным вниманием
Что это за инструмент
OmniServe — это унифицированный движок для инференса больших языковых моделей (LLM), объединяющий технологии квантования QServe и оптимизации длинных контекстов LServe.
Зачем нужен
Инструмент решает две ключевые проблемы: снижение вычислительной сложности за счет квантования W4A8KV4 и ускорение обработки длинных последовательностей через унифицированное разреженное внимание. Это позволяет значительно повысить пропускную способность GPU и сократить инфраструктурные затраты при развертывании LLM.
Что можно реализовать
- Развертывание LLM с высокой пропускной способностью для обслуживания большого числа запросов (large-batch).
- Обработка документов с очень длинным контекстом (long-context) без потери производительности.
- Снижение стоимости инфраструктуры за счет эффективного использования памяти и вычислений GPU.
- Использование готовых оптимизаций, уже интегрированных в NVIDIA TensorRT-LLM.
Ключевые возможности
- Квантование W4A8KV4 с минимизацией накладных расходов на деквантование.
- Унифицированное разреженное внимание (Unified Sparse Attention) для ускорения префиллинга и декодирования.
- Иерархическое управление KV-кэшем для эффективной работы с длинными последовательностями.
- Поддержка как текстовых LLM, так и мультимодальных языковых моделей (VLM).
- Гибкая настройка точности квантования и паттернов разреженного внимания.
👤 Кому подойдёт: Инженеры по машинному обучению (MLE), разработчики систем инференса LLM, исследователи в области оптимизации нейросетей.