Исследования18 августа 2026 г., 10:17 МСК🤖 Auto

CacheScout: ИИ-управление KV-кэшем ускоряет multi-agent LLM на 57%

Исследователи представили CacheScout — runtime-слой для vLLM, который использует машинное обучение для предсказания повторного использования контекста в multi-agent системах, радикально снижая задержки.

Баннер новости 5977

Проблема реактивного кэширования в агентах

В современных multi-agent LLM-системах запрос пользователя разбивается на цепочку специализированных агентов. Каждый агент оперирует фиксированным контекстом: системными промптами, определениями инструментов и few-shot примерами. Традиционные системы (включая стандартный vLLM) управляют KV-кэшем реактивно, полагаясь на префиксное кэширование и замену по принципу недавности (recency). Это приводит к тому, что полезный контекст агентов вытесняется из памяти до того, как он понадобится снова, заставляя модель заново вычислять токены.

Решение: CacheScout и семантика выполнения

Команда разработчиков во главе с Руи Чжаном (Rui Zhang) предложила CacheScout — слой управления кэшем, aware к семантике выполнения агентов. Ключевая инновация заключается в том, что система учится предсказывать переходы между состояниями агентов в онлайн-режиме. Это позволяет не просто хранить «последние» данные, а проактивно префетчить (предзагружать) контекст, который с высокой вероятностью понадобится следующему агенту, не нарушая критического пути обслуживания запросов.

Результаты бенчмарков

Тестирование проводилось на реальных рабочих нагрузках multi-agent систем. Внедрение CacheScout поверх vLLM показало значительный прирост эффективности, особенно в метриках задержки и пропускной способности:

Метрика Диапазон улучшения Максимальное улучшение
Hit rate KV-кэша +10–18 п.п.
Среднее время TTFT (Time to First Token) -18–45% -54% (на больших моделях)
Средняя задержка на ход (per-turn latency) -29–38%
Пиковая пропускная способность (Throughput) +57%

Масштабируемость

Эффект CacheScout не ограничивается моделями среднего размера. На более крупных моделях система сохраняет способность снижать TTFT до 54%, одновременно поддерживая пропускную способность на 37% выше, чем у базового решения. Это делает технологию критически важной для коммерческого развертывания сложных агентных сервисов, где каждый миллисекунда задержки влияет на пользовательский опыт.

Источник: arXiv cs.AI ↗