Проблема реактивного кэширования в агентах
В современных multi-agent LLM-системах запрос пользователя разбивается на цепочку специализированных агентов. Каждый агент оперирует фиксированным контекстом: системными промптами, определениями инструментов и few-shot примерами. Традиционные системы (включая стандартный vLLM) управляют KV-кэшем реактивно, полагаясь на префиксное кэширование и замену по принципу недавности (recency). Это приводит к тому, что полезный контекст агентов вытесняется из памяти до того, как он понадобится снова, заставляя модель заново вычислять токены.
Решение: CacheScout и семантика выполнения
Команда разработчиков во главе с Руи Чжаном (Rui Zhang) предложила CacheScout — слой управления кэшем, aware к семантике выполнения агентов. Ключевая инновация заключается в том, что система учится предсказывать переходы между состояниями агентов в онлайн-режиме. Это позволяет не просто хранить «последние» данные, а проактивно префетчить (предзагружать) контекст, который с высокой вероятностью понадобится следующему агенту, не нарушая критического пути обслуживания запросов.
Результаты бенчмарков
Тестирование проводилось на реальных рабочих нагрузках multi-agent систем. Внедрение CacheScout поверх vLLM показало значительный прирост эффективности, особенно в метриках задержки и пропускной способности:
| Метрика | Диапазон улучшения | Максимальное улучшение |
|---|---|---|
| Hit rate KV-кэша | +10–18 п.п. | — |
| Среднее время TTFT (Time to First Token) | -18–45% | -54% (на больших моделях) |
| Средняя задержка на ход (per-turn latency) | -29–38% | — |
| Пиковая пропускная способность (Throughput) | — | +57% |
Масштабируемость
Эффект CacheScout не ограничивается моделями среднего размера. На более крупных моделях система сохраняет способность снижать TTFT до 54%, одновременно поддерживая пропускную способность на 37% выше, чем у базового решения. Это делает технологию критически важной для коммерческого развертывания сложных агентных сервисов, где каждый миллисекунда задержки влияет на пользовательский опыт.
Источник: arXiv cs.AI ↗
