Проблема «узкого горлышка» памяти
Долгосрочная память остается критическим ограничением для conversational AI. Ограниченные окна контекста (context windows) не позволяют моделям сохранять связность при тысячах раундов диалога. Для решения этой проблемы автор представил AgentMemBench — унифицированный бенчмарк, оценивающий пять стратегий управления памятью в идентичных условиях.
Методология и инструменты
Тестирование проводилось на трех публичных датасетах: LoCoMo (многопользовательские диалоги), MultiDoc2Dial (документ-ориентированные задачи) и MSC (чат с привязкой к персоне). Все вычисления генерации и оценки (LLM-judge) выполнялись на модели Qwen2.5-7B-Instruct (4-bit) с жадным декодированием (greedy decoding) для детерминизма. Оценивались 491 аннотированных вопросных поворотов.
Результаты: EKV против остальных
Главный вывод исследования: внешние key-value хранилища (EKV) доминируют по всем метрикам качества. В то время как методы сжатия (CBS) и графовые подходы (GEM) показывают приемлемые результаты на коротких дистанциях, они полностью «ломаются» при запросах к событиям, произошедшим много сессий назад.
| Стратегия | Recall@5 (LoCoMo) | Macro Recall@5 | Memory Footprint | Комментарий |
|---|---|---|---|---|
| EKV (External KV) | 0.573 | 0.792 | ~5,100 токенов | Лидер по точности, но требует больше ресурсов |
| CBS (Compression) | — | 0.556 | — | Второе место по извлечению, но уступает EKV |
| ICW (In-context) | ≤ 0.005 | — | ~300 токенов | Почти нулевой recall на длинных дистанциях |
| GEM (Graph) | ≤ 0.005 | — | — | Графы сущностей не масштабируются на горизонте |
| WAM (Web-augmented) | — | — | — | Равен ICW по recall внутри корпуса |
Почему это важно для разработчиков
Исследование демонстрирует явную компромиссную зависимость (trade-off): EKV обеспечивает точность, но стоит дороже (~5,100 токенов памяти против ~300 у ICW/WAM). Однако для задач, требующих точного воспоминания фактов из далёких сессий, экономия токенов через сжатие (CBS) или графы (GEM) приводит к катастрофическому падению качества (Recall@5 ≤ 0.005). Также в бенчмарк включены оценки систем MemGPT/Letta и HippoRAG, что делает AgentMemBench референсом для выбора архитектуры памяти.
Источник: arXiv cs.CL ↗
