Исследования22 июля 2026 г., 06:17 МСК🤖 Auto

SelKV: Сжатие KV-кэша LLM без обучения с ускорением в 3.3 раза

Исследователи представили SelKV — метод сжатия ключ-значения кэша, который сохраняет качество генерации при 25% объема данных и ускоряет декодирование на длинных контекстах.

Баннер новости 4099

Проблема линейного роста памяти

Генерация текста в больших языковых моделях (LLM) происходит авторегрессивно, что требует хранения ключ-значения (KV) кэша. Объем этого кэша растет линейно с увеличением длины контекста, создавая серьезный узкий горлышко для обработки длинных документов. Существующие методы сжатия часто используют indiscriminate aggregation (безразличное агрегирование), что приводит к потере семантических представлений и эффекту «attention sag» — дисбалансу, при котором объединенные токены получают ту же массу softmax, что и отдельные, несмотря на кодирование нескольких входов.

Двухкомпонентное решение SelKV

Авторы предлагают тренировочный (training-free) фреймворк, состоящий из двух ключевых компонентов:

  • Soft Cosine Gate: Адаптивно регулирует решения по слиянию на основе сходства векторов значений. Это позволяет подавлять или отбрасывать несхожие токены, сохраняя семантическую верность.
  • Attention-Ratio Compensation: Механизм компенсации внимания, который применяет логит-смещение (logit bias) во время декодирования. Оно основано на статистике внимания prefill и исправляет дисбаланс softmax, вызванный слиянием токенов.

Результаты на LongBench

Метод был протестирован на наборе данных LongBench, включающем 16 англоязычных датасетов. Ключевым достижением стало сохранение качества генерации при удержании только 25% от исходного объема KV-кэша. Особая эффективность продемонстрирована на моделях с групповым запросом внимания (GQA), где качество оставалось практически без потерь.

Метрика / Параметр Результат SelKV Значение
Доля сохраненного KV-кэша 25% Сжатие в 4 раза
Ускорение декодирования 3.3x При длине контекста 100k токенов
Качество на сложных задачах Превосходство На многодокументном QA (Multi-document QA)
Сравнение с базой Конкурентоспособно Против one-shot baselines

Почему это важно

Метод SelKV демонстрирует, что эффективное сжатие контекста возможно без дообучения моделей, используя только инференс-тайм оптимизации. Это критически важно для развертывания LLM в условиях ограниченных ресурсов GPU и для работы с ультра-длинными контекстами (до 100k токенов), где традиционные подходы становятся экономически нецелесообразными из-за требований к памяти.

Источник: arXiv cs.AI ↗