Проблема статического бюджета
Генерация длинных текстов (long-output reasoning) создает критическую нагрузку на память из-за необходимости хранения ключей и значений (KV-cache). Существующие методы сжатия KV-кэша используют фиксированный бюджет на запрос, который не меняется в процессе декодирования. Это приводит к неэффективности: система либо тратит лишнюю память на простые запросы, либо теряет качество на сложных, где требуется больше контекста.
Решение: GrowPage
Новая архитектура GrowPage рассматривает емкость KV-кэша как динамический ресурс. Система использует двухвременные сводки запросов (dual-timescale query summaries) для оценки поведения внимания в краткосрочной и долгосрочной перспективе. На основе этих данных GrowPage решает: сжать текущие состояния или выделить дополнительную физическую страницу памяти, когда потребность в контексте возрастает.
Технические детали
Интеграция с абстракцией PagedAttention позволяет сохранить преимущества непрерывного батчинга (continuous batching) и кэширования префиксов (prefix caching). Это гарантирует, что оптимизация памяти не замедляет общую пропускную способность системы.
Результаты
Эксперименты на бенчмарках для рассуждений показали, что GrowPage обеспечивает лучший компромисс между производительностью и пропускной способностью по сравнению с существующими подходами. Метод позволяет эффективно обслуживать модели с переменным спросом на память, что критично для продакшн-развертывания сложных LLM.
Источник: arXiv cs.AI ↗
