Проблема стандартного кэширования в агентах
Агентные языковые модели (LLM) часто сталкиваются с повторным кодированием схем инструментов и навыков, которые комбинируются в разных порядках. Стандартное префиксное кэширование (prefix caching) неэффективно в таких сценариях, так как не может переиспользовать состояния ключ-значение (KV) из-за вариативности запросов. Это приводит к избыточным вычислениям и высокому потреблению памяти.
Решение: ReCache и Resource-wise Attention
Авторы предлагают фреймворк ReCache, который разделяет кодирование схем и доступ к ресурсам. Ключевые инновации:
- Resource-wise attention: Убирает перекрестные взаимодействия между ресурсами и назначает локальные позиции, создавая блоки KV, инвариантные к композиции.
- Селективный доступ: Ограничивает видимость ресурсов до маршрутов, выбранных по вкладу (layer-KV-head-group routes).
- Прунинг: Структурное и семантическое удаление не критичных полей вызова.
Результаты бенчмарков
Оценка проводилась на наборе данных, объединяющем семь публичных датасетов по использованию инструментов. ReCache демонстрирует сопоставимую с плотным вычислением точность (Inv-F1 82.3% против 82.4% у базовой модели), но с радикальным улучшением метрик производительности.
| Метрика | Результат ReCache | Сравнение / Эффект |
|---|---|---|
| Inv-F1 (Точность) | 82.3% | Сопоставимо с плотным вычислением (82.4%) |
| Time-to-First-Token (TTFT) | Ускорение в 3.655× | Значительное снижение задержки ответа |
| Выделение памяти (KV-tensor) | Сокращение на 92.43% | Экономия ресурсов GPU/CPU |
| Ускорение внимания (Attention) | 1.423× | Оптимизация вычислительного графа |
Значение для индустрии
Результаты показывают, что отделение переиспользуемого кодирования схем от селективного доступа к ресурсам позволяет существенно снизить стоимость инференса агентов. Это критически важно для масштабирования LLM-агентов в продакшене, где задержка и стоимость вычислений являются ключевыми барьерами. Код фреймворка доступен в открытом доступе.
Источник: arXiv cs.CL ↗
