Проблема линейного роста памяти
Генерация текста в больших языковых моделях (LLM) происходит авторегрессивно, что требует хранения ключ-значения (KV) кэша. Объем этого кэша растет линейно с увеличением длины контекста, создавая серьезный узкий горлышко для обработки длинных документов. Существующие методы сжатия часто используют indiscriminate aggregation (безразличное агрегирование), что приводит к потере семантических представлений и эффекту «attention sag» — дисбалансу, при котором объединенные токены получают ту же массу softmax, что и отдельные, несмотря на кодирование нескольких входов.
Двухкомпонентное решение SelKV
Авторы предлагают тренировочный (training-free) фреймворк, состоящий из двух ключевых компонентов:
- Soft Cosine Gate: Адаптивно регулирует решения по слиянию на основе сходства векторов значений. Это позволяет подавлять или отбрасывать несхожие токены, сохраняя семантическую верность.
- Attention-Ratio Compensation: Механизм компенсации внимания, который применяет логит-смещение (logit bias) во время декодирования. Оно основано на статистике внимания prefill и исправляет дисбаланс softmax, вызванный слиянием токенов.
Результаты на LongBench
Метод был протестирован на наборе данных LongBench, включающем 16 англоязычных датасетов. Ключевым достижением стало сохранение качества генерации при удержании только 25% от исходного объема KV-кэша. Особая эффективность продемонстрирована на моделях с групповым запросом внимания (GQA), где качество оставалось практически без потерь.
| Метрика / Параметр | Результат SelKV | Значение |
|---|---|---|
| Доля сохраненного KV-кэша | 25% | Сжатие в 4 раза |
| Ускорение декодирования | 3.3x | При длине контекста 100k токенов |
| Качество на сложных задачах | Превосходство | На многодокументном QA (Multi-document QA) |
| Сравнение с базой | Конкурентоспособно | Против one-shot baselines |
Почему это важно
Метод SelKV демонстрирует, что эффективное сжатие контекста возможно без дообучения моделей, используя только инференс-тайм оптимизации. Это критически важно для развертывания LLM в условиях ограниченных ресурсов GPU и для работы с ультра-длинными контекстами (до 100k токенов), где традиционные подходы становятся экономически нецелесообразными из-за требований к памяти.
Источник: arXiv cs.AI ↗
