Исследования8 июля 2026 г., 09:16 МСК🤖 Auto

Память внутри цикла: In-Process Retrieving ускоряет агентов в 83 раза

Исследование показывает, что перенос базы знаний внутрь контура работы LLM-агента снижает задержку с сотен миллисекунд до микросекунд, устраняя избыточные действия модели.

Баннер новости 3086

Проблема «внешней» памяти

Традиционные языковые агенты работают по циклу «наблюдение — рассуждение — действие», но их память (RAG-хранилища) находится вне этого цикла. Модель запрашивает данные не чаще одного раза за ход, что создает узкое горлышко. Авторы исследования (Yusuf Khan, Carlo Lipizzi) доказывают, что задержка — это свойство расположения хранилища, а не самого паттерна использования. Сетевые запросы к внешним базам занимают десятки или сотни миллисекунд, что может увеличивать общую задержку (end-to-end latency) до 83 раз.

Решение: In-Process Retrieval

Авторы предлагают перенести хранилище памяти внутрь процесса выполнения агента (in-process store). При такой архитектуре память читается и записывается на каждом шаге. Благодаря отсутствию сетевых задержек, время ответа хранилища падает до ~100 микросекунд (в три порядка быстрее сетевого режима). Это позволяет рассматривать память как «расширенную рабочую память» (extended working memory) по принципу паритета из расширенной разумной теории.

Ключевые метрики и бенчмарки

Эксперименты проводились на моделях класса GPT-5 (gpt-5-nano, gpt-5-mini) с фиксированным бюджетом задержки на ход. Результаты показали прямую корреляцию между скоростью ответа хранилища и качеством работы агента:

Параметр In-Process (локально) Cloud (сетевой, ~110ms)
Время ответа хранилища ~100 мкс ~110 000 мкс
Избыточные действия (из 12) 0.0 7.2
Recall (точность извлечения) 3.6–4.8 / 5 0 / 5
Потеря фактов (записи) 0 из 244 0 из 244

Статистическая значимость различий подтверждена точным перестановочным тестом (p=0.0079). Важно отметить: хранилище никогда не теряло данные (244 из 244 записей сохранены), все промахи связаны с политикой чтения агента, а не с надежностью базы.

Оптимизация через локальный эмбеддер

Исследование выявило новый узкий горлышко: доминирующей стоимостью на шаг стала генерация эмбеддингов (~200–400 мс через сеть). Авторы предлагают связать in-process хранилище с небольшим локальным эмбеддером. Это возвращает полную операцию извлечения к измеренным ~40 микросекундам, делая архитектуру практически мгновенной для агента.

Вывод

Переход к in-process memory устраняет необходимость в «memory-first» дизайнах, ограничивающих доступ к памяти. При скорости отклика в микросекундах агент может постоянно обращаться к памяти без штрафа по производительности, что кардинально меняет парадигму проектирования автономных AI-систем.

Источник: arXiv cs.AI ↗