Исследования10 сентября 2026 г., 07:19 МСК🤖 Auto

Память стоит денег: MERIT показал, когда LLM-агентам она нужна

Исследователи представили MERIT — первый бенчмарк, оценивающий долгосрочную память LLM-агентов через призму стоимости. Память повышает успех задач в 2-4 раза, но только при правильной архитектуре хранения.

Баннер новости 7142

Проблема старых метрик

Традиционные бенчмарки, такие как LoCoMo и LongMemEval, измеряют способность модели отвечать на вопросы по истории диалога. Однако они не учитывают, меняет ли «вспомненная» информация реальные действия агента, использующего инструменты (tools). Авторы статьи Shweta и Shashank Mishra утверждают, что для оценки реальной пользы памяти необходим подход, учитывающий стоимость токенов и влияние фактов на выполнение задач.

Что такое MERIT

Команда представила MERIT (Memory Evaluation for Realistic Instrumented Tasks) — платформу для оценки маржинальной полезности памяти. Ключевые особенности:

  • Эпизодические задачи: 3 домена с проверкой зависимости от фактов из предыдущих эпизодов (автоматический leak check).
  • Масштаб: 23 440 оцененных эпизодов.
  • Стоимость: Полный учет токенов и долларов за каждую операцию памяти.
  • Сложность: Лестница сложности, включающая обновление фактов и контролируемое повреждение памяти.

Ключевые результаты

В пилотном исследовании на моделях gpt-4.1-mini и preregistered сетке (GPT-4.1, Claude Haiku 4.5) было показано, что память критически важна для задач, зависящих от контекста. Без памяти успех падал до 0.00, с памятью — до 0.55–1.00.

Однако реализация памяти имеет значение. В таблице ниже приведены результаты по работе с обновленными фактами (updated facts), где модель должна помнить измененные данные:

Метод хранения/поиска Успех извлечения (Retrieval) Использование факта агентом Комментарий
Embedding Retrieval (векторный поиск) 0.30 - 0.95 55% Непредсказуемые результаты, большой разброс между семами (gap 0.45)
Structured Fact Store (структурированное хранилище) 0.70 - 1.00 Высокий Надежный метод, лучшая цена/качество
LLM Summarization (суммаризация) 0.70 - 1.00 Высокий Эффективно, но дороже
Hybrid (Гибрид) Хуже, чем простое структурированное хранилище

Экономическая эффективность

Самый важный вывод исследования — экономический. Полное воспроизведение истории (full replay) никогда не является экономически выгодным. Оптимальная конфигурация памяти в каждом домене обеспечивает в 2.7–3.9 раза больше маржинальной полезности на каждый потраченный доллар по сравнению с базовыми методами.

Замена реализации памяти может изменить успех задачи на до 60 процентных пунктов. Это означает, что архитектура памяти — не просто техническая деталь, а ключевой фактор производительности и стоимости LLM-агентов.

Почему это важно

Исследование демистифицирует «долгосрочную память» для агентов. Оно показывает, что простое хранение истории недостаточно. Для реальных задач с инструментами (tool-using agents) критически важны:

  1. Структурированное хранение фактов, а не только векторный поиск.
  2. Учет стоимости операций памяти при проектировании агентов.
  3. Проверка того, что агент действительно использует воспоминания для действий, а не просто цитирует их.

Авторы опубликовали код, данные и все трейсы (traces) для воспроизведения результатов.

Источник: arXiv cs.AI ↗