Исследования16 сентября 2026 г., 10:17 МСК🤖 Auto

KV-кэш: GPU, CPU или SSD? Результаты симуляции для долгих сессий

Исследование arXiv:2609.16215 показывает, что многоуровневое хранение KV-кэша увеличивает пропускную способность GPU в 73 раза, но популярные алгоритмы предсказания и префетчинга не оправдывают затрат.

Баннер новости 7607

Проблема дефицита HBM и решение через тиринг

Память HBM видеокарт (GPU) дорога и ограничена, а при работе с длинными сессиями, агентами и анализом документов KV-кэш быстро заполняет её. Системы вроде Mooncake, LMCache и FlexGen уже предлагают расширять память за счет CPU DRAM и SSD. Однако ключевой вопрос — какие блоки кэша должны находиться на каком уровне — остается открытым. Авторы исследования смоделировали эту задачу, сравнив стратегии размещения в среде, имитирующей работу GPU, CPU и SSD.

Масштабные улучшения от тиринга, а не от алгоритмов

Главный вывод работы: значительные приросты производительности дает сама архитектура многоуровневого кэша, а не сложность политики размещения. При конфигурации кэша 1 (GPU) + 8 (CPU) + 64 (SSD) ГБ система поддерживает в 73,02 раза больше одновременных сессий на один GPU, а стоимость одной сессии снижается в 62,04 раза.

При этом пропускная способность (throughput) при декодировании с размером батча 1 остается ограниченной вычислительной мощностью GPU, а не перемещением данных. Основное влияние политик размещения — на трафик миграции по шине PCIe и время до получения первого токена (TTFT).

Сравнение политик размещения

Авторы протестировали несколько стратегий: недавность (recency), частоту повторного использования (reuse frequency), предсказанное повторное использование и EWMA-предиктор с префетчингом. Результаты сильно зависят от типа нагрузки:

Тип нагрузки Лучшая политика Ключевая метрика / Наблюдение
Чат (Chat) Recency (Недавность) Генерирует в 2,30 раза меньше трафика миграции, чем частота повторного использования.
Агенты (Agents) Reuse Frequency Показывает наилучшие результаты по эффективности использования ресурсов.
Документы (RAG) Reuse Frequency Аналогично агентам, стратегия частоты повторного использования оказывается оптимальной.

Критика предсказаний и префетчинга

Исследование выявило серьезные проблемы с современными подходами к оптимизации:

  • Предсказанное повторное использование: В текущей реализации эта политика фактически идентична простой стратегии «recent» (недавность), что делает рекомендации для агентов неэффективными.
  • EWMA-предиктор: Хотя он меняет поведение системы, он все равно уступает простой частоте повторного использования на тех нагрузках, для которых создавался.
  • Префетчинг (Prefetching): Использование предварительной загрузки данных не оправдывает затрат пропускной способности. Даже «оракул» с знанием будущих запросов не смог превзойти отсутствие префетчинга по объему перемещаемых данных.

Вывод для разработчиков

Внедрение специфичных для нагрузки политик размещения может снизить объем перемещения данных, но текущие реализации алгоритмов предсказания и префетчинга не поддерживаются результатами симуляции. Оптимальная стратегия — это простое тиринг-хранилище с выбором между Recency (для чатов) и Reuse Frequency (для агентов и RAG).

Источник: arXiv cs.AI ↗