Исследования4 августа 2026 г., 08:16 МСК🤖 Auto

AgentMemBench: Почему внешние базы данных побеждают контекст в долгосрочной памяти

Исследование Ahmed Cherif показало, что стратегии сжатия и графов памяти не работают на длинных дистанциях, а внешние key-value хранилища (EKV) обеспечивают до 100-кратное преимущество в точности.

Баннер новости 5015

Проблема «узкого горлышка» памяти

Долгосрочная память остается критическим ограничением для conversational AI. Ограниченные окна контекста (context windows) не позволяют моделям сохранять связность при тысячах раундов диалога. Для решения этой проблемы автор представил AgentMemBench — унифицированный бенчмарк, оценивающий пять стратегий управления памятью в идентичных условиях.

Методология и инструменты

Тестирование проводилось на трех публичных датасетах: LoCoMo (многопользовательские диалоги), MultiDoc2Dial (документ-ориентированные задачи) и MSC (чат с привязкой к персоне). Все вычисления генерации и оценки (LLM-judge) выполнялись на модели Qwen2.5-7B-Instruct (4-bit) с жадным декодированием (greedy decoding) для детерминизма. Оценивались 491 аннотированных вопросных поворотов.

Результаты: EKV против остальных

Главный вывод исследования: внешние key-value хранилища (EKV) доминируют по всем метрикам качества. В то время как методы сжатия (CBS) и графовые подходы (GEM) показывают приемлемые результаты на коротких дистанциях, они полностью «ломаются» при запросах к событиям, произошедшим много сессий назад.

Стратегия Recall@5 (LoCoMo) Macro Recall@5 Memory Footprint Комментарий
EKV (External KV) 0.573 0.792 ~5,100 токенов Лидер по точности, но требует больше ресурсов
CBS (Compression) 0.556 Второе место по извлечению, но уступает EKV
ICW (In-context) ≤ 0.005 ~300 токенов Почти нулевой recall на длинных дистанциях
GEM (Graph) ≤ 0.005 Графы сущностей не масштабируются на горизонте
WAM (Web-augmented) Равен ICW по recall внутри корпуса

Почему это важно для разработчиков

Исследование демонстрирует явную компромиссную зависимость (trade-off): EKV обеспечивает точность, но стоит дороже (~5,100 токенов памяти против ~300 у ICW/WAM). Однако для задач, требующих точного воспоминания фактов из далёких сессий, экономия токенов через сжатие (CBS) или графы (GEM) приводит к катастрофическому падению качества (Recall@5 ≤ 0.005). Также в бенчмарк включены оценки систем MemGPT/Letta и HippoRAG, что делает AgentMemBench референсом для выбора архитектуры памяти.

Источник: arXiv cs.CL ↗