Исследования4 сентября 2026 г., 12:17 МСК🤖 Auto

InertiaKV: Прорыв в сжатии KV-кэша с ускорением до 1.46x

Исследователи из EMNLP 2026 представили InertiaKV — метод агрессивного удаления токенов, который сохраняет качество генерации, увеличивая пропускную способность декодирования.

Баннер новости 6762

Проблема: Почему старые методы сжатия не работают?

В последние годы исследования сжатия KV-кэша (Key-Value cache) во время декодирования фокусировались на создании новых функций оценки значимости токенов. Однако новая работа, принятая в основную программу конференции EMNLP 2026, доказывает, что временная агрегация (как оценки накапливаются во времени) и сохранение ранжирования являются критически важными факторами, которые ранее игнорировались.

Авторы обнаружили, что при агрессивном сжатии кэша модификации функций оценки, сохраняющие порядок токенов, дают практически идентичные результаты. Напротив, методы, меняющие ранжирование (например, KeyDiff или key norm), приводят к существенному падению качества генерации.

Решение: InertiaKV и InertiaKV-Lazy

На основе этих выводов команда разработала InertiaKV — метод, использующий экспоненциальное скользящее среднее (EMA) для агрегации оценок. Это обеспечивает стабильность ранжирования токенов. Также представлен вариант InertiaKV-Lazy, который обновляет кэш периодически, а не на каждом шаге, что дает дополнительный прирост скорости.

Результаты: Цифры и бенчмарки

Метод протестирован на шести открытых моделях (open-weight backbones) и трех сложных бенчмарках для длинных контекстов: LongBench, LongBench-v2 и RULER. Ключевые показатели эффективности:

Метрика / Метод Результат / Характеристика
Ускорение декодирования (InertiaKV-Lazy) 1.34x – 1.46x относительно полного обновления кэша
Изменение качества (Score-Free режим) +0.03 (практически без потери качества)
Стабильность ранжирования Value-norm и entropy-варианты сохраняют корреляцию с вниманием
Падение качества Наблюдается у методов, меняющих ранг (KeyDiff, recency)

Score-Free: Экстремальная оптимизация

Отдельно исследован режим Score-Free: оценка контекста производится только на первом шаге декодирования, после чего ранжирование «замораживается». Это полностью устраняет затраты на повторную оценку токенов. Среднее изменение качества при таком подходе составило всего +0.03, что делает его крайне привлекательным для приложений с жесткими требованиями к задержке.

Почему это важно?

Работа меняет парадигму проектирования LLM-инференса. Вместо поиска «идеальной» функции оценки токенов, инженерам следует фокусироваться на алгоритмах агрегации, которые минимизируют флуктуации в ранжировании значимых токенов. Это открывает путь к более эффективному развертыванию больших моделей с длинным контекстом без необходимости в дорогостоящем оборудовании.

Источник: arXiv cs.AI ↗