mit-han-lab/Quest
Quest: Запрос-ориентированная разреженность для эффективного вывода длинных LLM
Инференс⭐ 407Cuda
Что это за инструмент
Quest — это фреймворк для ускорения инференса длинноконтекстных LLM, использующий алгоритм оценки важности токенов на основе запроса (query-aware sparsity) для оптимизации работы с KV-кэшем.
Зачем нужен
Инструмент решает проблему падения скорости инференса при увеличении длины контекста, снижая объем перемещения данных при вычислении внимания (attention). Он позволяет загружать в память только наиболее критичные страницы KV-кэша, что значительно ускоряет процесс без потери точности.
Что можно реализовать
- Ускорение генерации текста в моделях с контекстным окном до 128k или 1M токенов
- Решение задач с длинными зависимостями, таких как извлечение ключей (passkey retrieval)
- Суммаризация длинных документов с использованием моделей LongChat или Llama
- Оптимизация вычислительных ресурсов при развертывании LLM на GPU (NVIDIA Ada6000, RTX4090)
Ключевые возможности
- До 7.03x ускорения операции self-attention за счет выборочной загрузки KV-кэша
- До 2.23x ускорения общего инференса (end-to-end) при пренебрежимо малой потере точности
- Поддержка семейств моделей Llama-3.1 и Mistral-v0.3
- Интеграция с Huggingface Transformers и использование Flash-Attention
- Наличие готовых скриптов для оценки точности (LongBench, PG-19) и производительности
👤 Кому подойдёт: Исследователи в области NLP, ML-инженеры, разработчики систем инференса LLM, оптимизирующие производительность длинноконтекстных моделей.
Релизы
Релизы ещё не отслежены — появятся после ближайшего опроса.