SqueezeAILab/KVQuant
[NeurIPS 2024] KVQuant: Инференс LLM с контекстом до 10 миллионов токенов с помощью квантования KV Cache
Инференс⭐ 435Python
Что это за инструмент
KVQuant — это метод квантования KV-кэша для больших языковых моделей, позволяющий эффективно обрабатывать контекст длиной до 10 миллионов токенов.
Зачем нужен
Инструмент решает проблему нехватки памяти GPU при инференсе длинных контекстов за счет снижения точности хранения KV-кэша. Он сохраняет высокую точность модели, используя специализированные техники квантования, что делает возможным запуск LLM с огромным контекстом на ограниченном оборудовании.
Что можно реализовать
- Запуск LLaMA-7B с контекстом 1M токенов на одном GPU A100-80GB
- Инференс Large World Model (LWM) с длиной контекста до 1M токенов
- Оптимизация работы с длинными документами или логами в RAG-системах
- Снижение затрат на инфраструктуру для сервисов с длинным контекстом
Ключевые возможности
- Поддержка контекста до 10M токенов на 8-GPU системе
- Per-channel, Pre-RoPE квантование Key для работы с выбросами
- Non-Uniform Quantization (NUQ) для неuniform активаций
- Dense-and-Sparse Quantization для минимизации влияния числовых выбросов
- Attention Sink-Aware Quantization (сохранение первых токенов в fp16)
👤 Кому подойдёт: ML-инженеры, исследователи в области NLP, разработчики LLM-инфраструктуры
Релизы
Релизы ещё не отслежены — появятся после ближайшего опроса.