Проблема: разрыв в оценке многошаговой памяти
Современные системы долговременной памяти для LLM-агентов часто оцениваются по метрикам одномоментного recalls (single-hop), игнорируя способность связывать разрозненные факты. Это создает слепую зону: агент может помнить имя, но не уметь вывести связь между двумя событиями, произошедшими в разных сессиях. Для измерения именно этой способности автор вводит новый бенчмарк MemHop.
Решение: двухслойная архитектура ProGraph
Profile-Graph Memory (ProGraph) предлагает минималистичную альтернативу сложным графам знаний, используя два ключевых механизма:
- Profile Expansion (Расширение профилей): Трассировка сущностей через подстроки имен, которые естественным образом возникают в нарративных профилях, написанных самим LLM. Это позволяет находить связи «из воздуха» без явного построения графа.
- Compression Residuals (Компрессионные остатки): Параллельное извлечение точных дат, количественных значений и именованных объектов при каждом обновлении профиля. Это происходит с нулевыми дополнительными затратами API, так как данные извлекаются из уже существующего контекста.
Метрики и результаты
ProGraph демонстрирует выдающиеся результаты, превосходя как базовый контекст (FullContext), так и существующие SOTA-решения (Mem0, A-Mem, HippoRAG, RAG). Архитектура показала специализацию механизмов: расширение профилей критично для многошагового вывода, а компрессионные остатки — для точности.
| Метрика / Модель | Результат | Примечание |
|---|---|---|
| MemHop (ProGraph) | 80.1% | Совпадает с эталоном FullContext |
| LoCoMo (ProGraph) | 78.4% | Превосходит FullContext на 11.3pp |
| Удаление Profile Expansion | -22.6pp | На MemHop (критично для multi-hop) |
| Удаление Compression Residuals | -8.6pp | На LoCoMo (критично для precision) |
Значение для индустрии
Работа доказывает, что эффективная память для агентов не требует тяжелых внешних графовых баз данных. Комбинация естественного языка (нарративы) и структурированных остатков (даты/цифры) позволяет достичь точности эталонного полного контекста при значительно меньших вычислительных затратах. Исследователь опубликовал код и бенчмарк MemHop для сообщества.
Источник: arXiv cs.AI ↗
