Проблема: агенты забывают, с чего начали
Агентные системы на базе больших языковых моделей (LLM), генерирующие код через многошаговое использование инструментов, сталкиваются с фундаментальной проблемой: каждый новый сеанс начинается с нуля. Система сбрасывает конфигурации, ограничения домена, схемы данных и паттерны использования инструментов, которые сделали предыдущие сессии продуктивными. Простое сохранение всей истории диалога неэффективно: это тратит токены и, что хуже, «шумный» контекст снижает качество генерации.
Решение: Shared Selective Persistent Memory
Команда авторов (Sanjana Pedada, Aditya Dhavala, Neelraj Patil) предложила архитектуру, которая идентифицирует и сохраняет только четыре категории повторно используемого контекста, отбрасывая специфичные для сессии цепочки рассуждений:
- Спецификации задач (task specifications)
- Схемы данных (data schemas)
- Конфигурации инструментов (tool configurations)
- Ограничения вывода (output constraints)
Ключевая особенность — разделяемость памяти. Рабочие пространства, инкапсулирующие этот селективный контекст, могут передаваться между пользователями с контролем доступа на основе ролей (RBAC), что позволяет совместно использовать настройки без дублирования спецификаций.
Результаты: цифры, которые важны
Внедрение системы протестировано на развернутой платформе совместной работы, где AI-агенты создают и редактируют артефакты (дашборды, отчеты) из разнородных источников (CSV, SQL, REST API, MCP-серверы). Результаты по трем корпоративным сценариям демонстрируют значительный прогресс:
| Метрика | Без памяти | С полной историей | С Shared Selective Memory |
|---|---|---|---|
| Успешность выполнения задач | 79% | 71% | 96% |
| Снижение времени задачи (Zero-token refresh) | — | — | 14x |
| Снижение стоимости токенов (на вызов) | — | — | 97x |
Механизм «обновления без токенов» (zero-token data refresh) отделяет сгенерированные программы от данных во время выполнения, позволяя переиспользовать артефакты без повторного обращения к LLM. Это устранило необходимость повторных вызовов для повторяющихся обновлений.
Почему это важно
Исследование подтверждает, что «наивное» сохранение всей истории диалога не просто бесполезно, но и вредно: оно смещает фокус агента на устаревшие цепочки рассуждений, снижая точность. Селективная память, напротив, обеспечивает обобщаемость: репликация на четырех публичных наборах данных показала 100% успех (12/12) механизма обновления без токенов. Это шаг к созданию устойчивых, коллаборативных AI-систем, которые не «забывают» контекст и работают дешевле.
Источник: arXiv cs.AI ↗
