mit-han-lab/Quest

Quest: Запрос-ориентированная разреженность для эффективного вывода длинных LLM

Инференс⭐ 407Cuda
Открыть на GitHub ↗

Что это за инструмент

Quest — это фреймворк для ускорения инференса длинноконтекстных LLM, использующий алгоритм оценки важности токенов на основе запроса (query-aware sparsity) для оптимизации работы с KV-кэшем.

Зачем нужен

Инструмент решает проблему падения скорости инференса при увеличении длины контекста, снижая объем перемещения данных при вычислении внимания (attention). Он позволяет загружать в память только наиболее критичные страницы KV-кэша, что значительно ускоряет процесс без потери точности.

Что можно реализовать

  • Ускорение генерации текста в моделях с контекстным окном до 128k или 1M токенов
  • Решение задач с длинными зависимостями, таких как извлечение ключей (passkey retrieval)
  • Суммаризация длинных документов с использованием моделей LongChat или Llama
  • Оптимизация вычислительных ресурсов при развертывании LLM на GPU (NVIDIA Ada6000, RTX4090)

Ключевые возможности

  • До 7.03x ускорения операции self-attention за счет выборочной загрузки KV-кэша
  • До 2.23x ускорения общего инференса (end-to-end) при пренебрежимо малой потере точности
  • Поддержка семейств моделей Llama-3.1 и Mistral-v0.3
  • Интеграция с Huggingface Transformers и использование Flash-Attention
  • Наличие готовых скриптов для оценки точности (LongBench, PG-19) и производительности

👤 Кому подойдёт: Исследователи в области NLP, ML-инженеры, разработчики систем инференса LLM, оптимизирующие производительность длинноконтекстных моделей.

Релизы

Релизы ещё не отслежены — появятся после ближайшего опроса.