Проблема: тупик между абстракцией и детализацией
Современные AI-агенты страдают от «амнезии»: они не сохраняют контекст между сессиями, заставляя модель постоянно перечитывать всю историю диалога. Существующие решения делятся на два лагеря, каждый из которых имеет критический недостаток:
- Системы фрагментации (RAG, Mem0): сохраняют сырые факты. Это сохраняет детали, но создает шум и теряет связность повествования.
- Системы абстракции (графы знаний, Zep): сжимают информацию в резюме. Это эффективно, но приводит к потере важных нюансов, дат и имен.
Microsoft Research предлагает решение, которое устраняет этот компромисс, разделяя что хранится, и как это ищется.
Архитектура Memora: гармоничная организация
Ключевая инновация Memora — разделение памяти на два независимых слоя. Каждый элемент памяти состоит из:
- Primary Abstraction (Основная абстракция): короткая фраза (6–8 слов), которая служит «якорем» для семантического поиска. Именно она эмбеддится и индексируется.
- Memory Value (Значение памяти): богатый контент (полный диалог, таймлайн, детали), который никогда не используется для прямого поиска, но доступен при чтении.
Дополнительно используются Cue Anchors (Якоря-подсказки) — динамически генерируемые теги, позволяющие находить одну и ту же запись через разные контексты (например, по имени сотрудника или дедлайну), без необходимости жесткой онтологии.
Умный поиск: Policy-Guided Retriever
Memora не просто ищет похожие документы. Она использует Policy-Guided Retriever — систему, которая рассматривает поиск как процесс рассуждения. Алгоритм итеративно уточняет запрос, переходит по якорям-подсказкам к связанным, но не обязательно семантически близким событиям, и решает, когда остановиться. Это позволяет агенту восстанавливать сложные многошаговые зависимости, как это делает человек.
Результаты: SOTA на бенчмарках
Memora протестирована на двух сложных наборах данных для длинных контекстов: LoCoMo (диалоги по 600+ реплик) и LongMemEval (контекст до 115 000 токенов). Результаты демонстрируют прорыв как в точности, так и в эффективности.
| Метрика / Система | LoCoMo (LLM-judge) | LongMemEval | Эффективность (токены/записи) |
|---|---|---|---|
| Memora (Microsoft) | 86.3% | 87.4% | Экономия до 98% токенов; ~344 записи/диалог |
| Mem0 | Ниже 86.3% | Ниже 87.4% | ~651 записи/диалог (в 2 раза больше) |
| Full-Context Inference | Ниже 86.3% | Ниже 87.4% | 100% потребления контекста (базовый уровень) |
| RAG / Zep / LangMem | Ниже 86.3% | Ниже 87.4% | Уступают в точности и объеме данных |
Наибольшее преимущество Memora проявляется в задачах multi-hop reasoning (многошагового рассуждения), где способность переходить по якорям дает существенный прирост точности по сравнению с простым семантическим поиском.
Значение для индустрии
Публикация работы в ICML 2026 и открытый код на GitHub (github.com/microsoft/Memora) сигнализируют о сдвиге в сторону автономных агентов, способных работать месяцами. Memora позволяет создавать системы, которые не просто хранят историю, а накапливают экспертные знания, оставаясь при этом экономичными в использовании вычислительных ресурсов.
Источник: Microsoft Research ↗
