Исследования3 сентября 2026 г., 12:16 МСК🤖 Auto

HeadWiseKV: Экономия 8.6% памяти и рост контекста до 161K без переобучения

Исследователи представили HeadWiseKV — метод сжатия KV-кэша для гибридных LLM, который позволяет увеличить максимальный контекст с 114K до 161K токенов, снижая пиковое потребление GPU-памяти на 8.59% без потери качества генерации.

Баннер новости 6668

Проблема: «Узкое горлышко» гибридных моделей

Гибридные языковые модели (Hybrid LLMs), сочетающие локальные, рекуррентные и глобальные слои внимания, сталкиваются с критической проблемой при инференсе: глобальные слои требуют хранения огромных объемов ключей и значений (KV-cache). Это приводит к переполнению памяти GPU и снижению пропускной способности генерации. Традиционные методы сжатия часто нарушают архитектуру модели, но HeadWiseKV предлагает решение без дообучения (training-free), сохраняя нативные пути локального и линейного внимания.

Решение: Бюджетирование на уровне голов (Heads)

Авторы предлагают распределять ограниченный бюджет памяти KV-кэша на уровне отдельных физических голов внимания. Каждая голова получает статичное многоуровневое историческое окно, что делает потребление памяти предсказуемым еще до начала обслуживания запроса. Ключевым алгоритмом является SeqCalib, который:

  • Обрабатывает слои в порядке их выполнения;
  • Учитывает взаимодействия между слоями, принимая решения на основе политик нижележащих слоев;
  • Формулирует задачу как ограниченную операционную задачу «скорость-искажение» (rate-distortion).

Результаты: Qwen3.6-27B и бенчмарки

Эксперименты проводились на модели Qwen3.6-27B и четырех других гибридных моделях. Метод демонстрирует стабильность качества на бенчмарках RULER и LoCoMo, сохраняя показатели, близкие к полному KV-кэшу (Full-KV). Ниже приведены ключевые метрики эффективности на контексте 112K токенов:

Метрика Результат HeadWiseKV Значение для инференса
Снижение пиковой памяти GPU 8.59% Возможность запустить более крупные модели или батчи на том же железе
Макс. успешный контекст 161K токенов (рост с 114K) Расширение границ работы с длинными документами
Качество генерации Близко к Full-KV (RULER/LoCoMo) Отсутствие деградации ответа при сжатии кэша

Почему это важно

HeadWiseKV решает фундаментальную проблему масштабируемости гибридных архитектур. Предоставляя способ «материализовать» политику кэша на рантайме (grouped-cache runtime), метод позволяет гибко управлять ресурсами GPU без компромиссов в точности. Это делает гибридные модели более доступными для продакшена, где длина контекста часто превышает стандартные лимиты, а стоимость вычислений должна быть оптимизирована.

Источник: arXiv cs.AI ↗