Исследования22 августа 2026 г., 06:18 МСК🤖 Auto

ReCache: ускорение LLM-агентов в 3.6x и экономия памяти на 92%

Исследователи представили ReCache — фреймворк для переиспользования KV-кэша в агентах с инструментами, обеспечивающий ускорение первого токена в 3.655 раза и сокращение памяти на 92.43% без потери качества.

Баннер новости 6291

Проблема стандартного кэширования в агентах

Агентные языковые модели (LLM) часто сталкиваются с повторным кодированием схем инструментов и навыков, которые комбинируются в разных порядках. Стандартное префиксное кэширование (prefix caching) неэффективно в таких сценариях, так как не может переиспользовать состояния ключ-значение (KV) из-за вариативности запросов. Это приводит к избыточным вычислениям и высокому потреблению памяти.

Решение: ReCache и Resource-wise Attention

Авторы предлагают фреймворк ReCache, который разделяет кодирование схем и доступ к ресурсам. Ключевые инновации:

  • Resource-wise attention: Убирает перекрестные взаимодействия между ресурсами и назначает локальные позиции, создавая блоки KV, инвариантные к композиции.
  • Селективный доступ: Ограничивает видимость ресурсов до маршрутов, выбранных по вкладу (layer-KV-head-group routes).
  • Прунинг: Структурное и семантическое удаление не критичных полей вызова.

Результаты бенчмарков

Оценка проводилась на наборе данных, объединяющем семь публичных датасетов по использованию инструментов. ReCache демонстрирует сопоставимую с плотным вычислением точность (Inv-F1 82.3% против 82.4% у базовой модели), но с радикальным улучшением метрик производительности.

Метрика Результат ReCache Сравнение / Эффект
Inv-F1 (Точность) 82.3% Сопоставимо с плотным вычислением (82.4%)
Time-to-First-Token (TTFT) Ускорение в 3.655× Значительное снижение задержки ответа
Выделение памяти (KV-tensor) Сокращение на 92.43% Экономия ресурсов GPU/CPU
Ускорение внимания (Attention) 1.423× Оптимизация вычислительного графа

Значение для индустрии

Результаты показывают, что отделение переиспользуемого кодирования схем от селективного доступа к ресурсам позволяет существенно снизить стоимость инференса агентов. Это критически важно для масштабирования LLM-агентов в продакшене, где задержка и стоимость вычислений являются ключевыми барьерами. Код фреймворка доступен в открытом доступе.

Источник: arXiv cs.CL ↗