Проблема: «Узкое горлышко» гибридных моделей
Гибридные языковые модели (Hybrid LLMs), сочетающие локальные, рекуррентные и глобальные слои внимания, сталкиваются с критической проблемой при инференсе: глобальные слои требуют хранения огромных объемов ключей и значений (KV-cache). Это приводит к переполнению памяти GPU и снижению пропускной способности генерации. Традиционные методы сжатия часто нарушают архитектуру модели, но HeadWiseKV предлагает решение без дообучения (training-free), сохраняя нативные пути локального и линейного внимания.
Решение: Бюджетирование на уровне голов (Heads)
Авторы предлагают распределять ограниченный бюджет памяти KV-кэша на уровне отдельных физических голов внимания. Каждая голова получает статичное многоуровневое историческое окно, что делает потребление памяти предсказуемым еще до начала обслуживания запроса. Ключевым алгоритмом является SeqCalib, который:
- Обрабатывает слои в порядке их выполнения;
- Учитывает взаимодействия между слоями, принимая решения на основе политик нижележащих слоев;
- Формулирует задачу как ограниченную операционную задачу «скорость-искажение» (rate-distortion).
Результаты: Qwen3.6-27B и бенчмарки
Эксперименты проводились на модели Qwen3.6-27B и четырех других гибридных моделях. Метод демонстрирует стабильность качества на бенчмарках RULER и LoCoMo, сохраняя показатели, близкие к полному KV-кэшу (Full-KV). Ниже приведены ключевые метрики эффективности на контексте 112K токенов:
| Метрика | Результат HeadWiseKV | Значение для инференса |
|---|---|---|
| Снижение пиковой памяти GPU | 8.59% | Возможность запустить более крупные модели или батчи на том же железе |
| Макс. успешный контекст | 161K токенов (рост с 114K) | Расширение границ работы с длинными документами |
| Качество генерации | Близко к Full-KV (RULER/LoCoMo) | Отсутствие деградации ответа при сжатии кэша |
Почему это важно
HeadWiseKV решает фундаментальную проблему масштабируемости гибридных архитектур. Предоставляя способ «материализовать» политику кэша на рантайме (grouped-cache runtime), метод позволяет гибко управлять ресурсами GPU без компромиссов в точности. Это делает гибридные модели более доступными для продакшена, где длина контекста часто превышает стандартные лимиты, а стоимость вычислений должна быть оптимизирована.
Источник: arXiv cs.AI ↗
