Проблема «внешней» памяти
Традиционные языковые агенты работают по циклу «наблюдение — рассуждение — действие», но их память (RAG-хранилища) находится вне этого цикла. Модель запрашивает данные не чаще одного раза за ход, что создает узкое горлышко. Авторы исследования (Yusuf Khan, Carlo Lipizzi) доказывают, что задержка — это свойство расположения хранилища, а не самого паттерна использования. Сетевые запросы к внешним базам занимают десятки или сотни миллисекунд, что может увеличивать общую задержку (end-to-end latency) до 83 раз.
Решение: In-Process Retrieval
Авторы предлагают перенести хранилище памяти внутрь процесса выполнения агента (in-process store). При такой архитектуре память читается и записывается на каждом шаге. Благодаря отсутствию сетевых задержек, время ответа хранилища падает до ~100 микросекунд (в три порядка быстрее сетевого режима). Это позволяет рассматривать память как «расширенную рабочую память» (extended working memory) по принципу паритета из расширенной разумной теории.
Ключевые метрики и бенчмарки
Эксперименты проводились на моделях класса GPT-5 (gpt-5-nano, gpt-5-mini) с фиксированным бюджетом задержки на ход. Результаты показали прямую корреляцию между скоростью ответа хранилища и качеством работы агента:
| Параметр | In-Process (локально) | Cloud (сетевой, ~110ms) |
|---|---|---|
| Время ответа хранилища | ~100 мкс | ~110 000 мкс |
| Избыточные действия (из 12) | 0.0 | 7.2 |
| Recall (точность извлечения) | 3.6–4.8 / 5 | 0 / 5 |
| Потеря фактов (записи) | 0 из 244 | 0 из 244 |
Статистическая значимость различий подтверждена точным перестановочным тестом (p=0.0079). Важно отметить: хранилище никогда не теряло данные (244 из 244 записей сохранены), все промахи связаны с политикой чтения агента, а не с надежностью базы.
Оптимизация через локальный эмбеддер
Исследование выявило новый узкий горлышко: доминирующей стоимостью на шаг стала генерация эмбеддингов (~200–400 мс через сеть). Авторы предлагают связать in-process хранилище с небольшим локальным эмбеддером. Это возвращает полную операцию извлечения к измеренным ~40 микросекундам, делая архитектуру практически мгновенной для агента.
Вывод
Переход к in-process memory устраняет необходимость в «memory-first» дизайнах, ограничивающих доступ к памяти. При скорости отклика в микросекундах агент может постоянно обращаться к памяти без штрафа по производительности, что кардинально меняет парадигму проектирования автономных AI-систем.
Источник: arXiv cs.AI ↗
