Исследования21 июля 2026 г., 06:17 МСК🤖 Auto

VarRate: Сжатие KV-кэша без дообучения с точностью до 0.8 балла

Исследователи представили VarRate — метод сжатия ключ-значения (KV) кэша для длинных контекстов, который распределяет ранг по токенам на основе их значимости, избегая необратимого удаления информации.

Баннер новости 4004

Проблема: тупик существующих методов

Память (KV-кэш) остается главным узким местом при инференсе больших языковых моделей (LLM) с длинным контекстом. Существующие обучаемые (training-free) подходы делятся на два типа, каждый из которых имеет критический недостаток:

  • Методы выбора токенов (SnapKV, Ada-KV): Оценивают важность токенов в окне наблюдения и удаляют «слабые». Проблема в необратимости: при повторном использовании контекста (query-agnostic reuse) сигнал важности деградирует, что приводит к падению точности на 11–15 баллов.
  • Унифицированное низкоранговое кодирование: Сохраняет каждый токен, но распределяет бюджет ранга равномерно. Это неэффективно, так как «важные» токены получают меньше ресурсов, чем нужно, а «мусорные» — больше.

Решение: VarRate — распределение ранга, а не удаление

Авторы (Shahrzad Esmat, Dhawal Shahar, Ali Jannesari) предлагают VarRate — кодек, который присваивает каждому токену переменный бюджет низкого ранга (low-rank budget) на основе его значимости для текущего запроса (query salience). Ключевое отличие: ни один токен не отбрасывается, все сохраняются с ненулевым рангом. Это позволяет избежать катастрофической потери точности, характерной для методов отсечения.

Результаты: точность и эффективность

На бенчмарке LongBench (16 задач) при сжатии до 20% бюджета памяти VarRate демонстрирует выдающиеся результаты. На моделях Llama-3.1-8B и Qwen2.5-7B падение точности составляет всего 3.5–5.5 баллов по сравнению с полной моделью, что значительно лучше конкурентов. В среднем по двум моделям VarRate является самым сильным компрессором с ограниченной памятью.

Метод Падение точности (LongBench) Примечание
VarRate (20% бюджет) 3.5–5.5 баллов Самый сильный компрессор с ограниченной памятью
Методы выбора (SnapKV/Ada-KV) 11–15 баллов Критическое падение при повторном использовании контекста
VarRate vs. Uncompressed В пределах 0.8 баллов На Llama-3.1-8B и Qwen2.5-7B
VarRate vs. KVzip Эквивалентна точности При этом overhead prefill в 8 раз меньше

Почему это важно

VarRate решает фундаментальную проблему баланса между объемом памяти и качеством ответа. В отличие от адаптивных кодеков, требующих дообучения, VarRate работает без обучения (training-free), что делает его применимым к любым новым моделям «из коробки». Кроме того, метод значительно превосходит унифицированные абляции и конкурирует с KVzip (специализированным методом для повторного использования контекста), но делает это с восьмикратным снижением накладных расходов на префилл (prefill overhead). Это открывает путь к эффективному обслуживанию длинных контекстов на ресурсоограниченном оборудовании.

Источник: arXiv cs.CL ↗