Проблема старых метрик
Традиционные бенчмарки, такие как LoCoMo и LongMemEval, измеряют способность модели отвечать на вопросы по истории диалога. Однако они не учитывают, меняет ли «вспомненная» информация реальные действия агента, использующего инструменты (tools). Авторы статьи Shweta и Shashank Mishra утверждают, что для оценки реальной пользы памяти необходим подход, учитывающий стоимость токенов и влияние фактов на выполнение задач.
Что такое MERIT
Команда представила MERIT (Memory Evaluation for Realistic Instrumented Tasks) — платформу для оценки маржинальной полезности памяти. Ключевые особенности:
- Эпизодические задачи: 3 домена с проверкой зависимости от фактов из предыдущих эпизодов (автоматический leak check).
- Масштаб: 23 440 оцененных эпизодов.
- Стоимость: Полный учет токенов и долларов за каждую операцию памяти.
- Сложность: Лестница сложности, включающая обновление фактов и контролируемое повреждение памяти.
Ключевые результаты
В пилотном исследовании на моделях gpt-4.1-mini и preregistered сетке (GPT-4.1, Claude Haiku 4.5) было показано, что память критически важна для задач, зависящих от контекста. Без памяти успех падал до 0.00, с памятью — до 0.55–1.00.
Однако реализация памяти имеет значение. В таблице ниже приведены результаты по работе с обновленными фактами (updated facts), где модель должна помнить измененные данные:
| Метод хранения/поиска | Успех извлечения (Retrieval) | Использование факта агентом | Комментарий |
|---|---|---|---|
| Embedding Retrieval (векторный поиск) | 0.30 - 0.95 | 55% | Непредсказуемые результаты, большой разброс между семами (gap 0.45) |
| Structured Fact Store (структурированное хранилище) | 0.70 - 1.00 | Высокий | Надежный метод, лучшая цена/качество |
| LLM Summarization (суммаризация) | 0.70 - 1.00 | Высокий | Эффективно, но дороже |
| Hybrid (Гибрид) | — | — | Хуже, чем простое структурированное хранилище |
Экономическая эффективность
Самый важный вывод исследования — экономический. Полное воспроизведение истории (full replay) никогда не является экономически выгодным. Оптимальная конфигурация памяти в каждом домене обеспечивает в 2.7–3.9 раза больше маржинальной полезности на каждый потраченный доллар по сравнению с базовыми методами.
Замена реализации памяти может изменить успех задачи на до 60 процентных пунктов. Это означает, что архитектура памяти — не просто техническая деталь, а ключевой фактор производительности и стоимости LLM-агентов.
Почему это важно
Исследование демистифицирует «долгосрочную память» для агентов. Оно показывает, что простое хранение истории недостаточно. Для реальных задач с инструментами (tool-using agents) критически важны:
- Структурированное хранение фактов, а не только векторный поиск.
- Учет стоимости операций памяти при проектировании агентов.
- Проверка того, что агент действительно использует воспоминания для действий, а не просто цитирует их.
Авторы опубликовали код, данные и все трейсы (traces) для воспроизведения результатов.
Источник: arXiv cs.AI ↗
