Проблема: Память агентов не обновляется
По мере того как LLM-агенты берут на себя более сложные и долгосрочные задачи, их системы памяти демонстрируют критический недостаток. Существующие бенчмарки фокусируются на простом воспроизведении фактов (recall), но игнорируют динамику. Если в ходе долгого взаимодействия факты, ограничения или решения меняются, агент должен опираться на текущее состояние, а не на устаревшие данные. Эта способность определена авторами как state tracking (отслеживание состояния).
StateMemBench: 234 сценариев для проверки
Для оценки этой способности команда создала StateMemBench — бенчмарк, состоящий из 234 многопользовательских сценариев, охватывающих два режима длины диалога. Методика оценки (closed-pool grading) строго классифицирует ответы: отражает ли ответ текущее состояние, устаревшее состояние или является ошибкой. Это позволяет изолировать именно провалы в отслеживании изменений, отделяя их от других типов ошибок.
Результаты: StateMem против существующих решений
Авторы предложили метод StateMem, который явно отслеживает замену фактов (supersession) и реляционные зависимости. В сравнении с сильнейшими базовыми моделями и системами памяти, StateMem демонстрирует значительный прирост точности:
| Модель / Бэкенд | Базовая точность (Current-State) | Точность с StateMem | Улучшение (x) |
|---|---|---|---|
| DeepSeek-V4-Flash (база) | 0.205 | 0.363 | 1.8x |
| Qwen-3.5-9B (лучшая память) | 0.149 | 0.233 | 1.6x |
Важно отметить, что StateMem остается конкурентоспособным по сравнению с подходами на основе длинного контекста (long-context baselines), но при этом требует меньше вычислительных ресурсов на обработку истории.
Универсальность: Легковесный обертка
Ключевое преимущество StateMem — его можно использовать как легковесную обертку (single-call wrapper) поверх существующих систем памяти и retrieval-механизмов. Тестирование на шести различных бэкендах показало прирост точности на +32–67 пунктов (процентов). Контрольные эксперименты, выровненные по длине и стоимости, показали, что +15–32 пункта этого прироста обусловлены именно структурой состояния, а не просто добавлением большего объема контекста.
Почему это важно
Для разработчиков AI-агентов это означает переход от простой «хранящей» памяти к «понимающей» память. StateMem позволяет создавать агентов, которые не путаются в собственных предыдущих заявлениях при изменении условий задачи, что критично для финансовых, юридических и медицинских приложений, где актуальность данных является вопросом безопасности и надежности.
Источник: arXiv cs.AI ↗
