Исследования3 октября 2026 г., 01:19 МСК🤖 Auto

Память агента: почему 68% прироста точности — это иллюзия

Исследование Juli Huang доказывает, что большинство бенчмарков для LLM-агентов смешивают способность запоминать и способность искать, завышая реальные показатели на 53,2 процентных пункта.

Баннер новости 8821

Проблема смешанных метрик

В разработке автономных AI-агентов с ограниченной памятью (bounded-memory) существует критическая методологическая ошибка. Авторы исследования показывают, что стандартные оценки часто не могут разделить два процесса: удержание информации (retention) и выборку при запросе (retrieval/selection). Когда методы сравниваются без фиксации доступа к истории, разница в результатах может быть обусловлена не качеством памяти, а тем, какие именно данные были доступны модели в момент ответа.

Ключевые цифры и метрики

Исследование использовало бенчмарк с 300 засыпанными эпизодами (seeded episodes), где фиксировался доступ к истории. Результаты выявили существенный разрыв между «чистой» эффективностью выбора и смешанными показателями:

Метрика / Условие Результат Примечание
Прирост recall при query-aware выборе (фикс. доступ) +15.5 п.п. 95% CI: 12.8 to 18.2
Общий прирост в смешанном сравнении +68.7 п.п. Сравнение методов с разным доступом к истории
Доля прироста, обусловленная доступом +53.2 п.п. Искусственное завышение за счет доступа к данным
Уровень recall при удалении в прошлое 0% Цели, ушедшие слишком далеко, не извлекаются

Природа ошибок: Eviction vs Ranking

Один из самых важных выводов касается природы провалов агентов. В условиях ограниченной памяти (bounded recency) все 319 наблюдаемых ошибок были вызваны не тем, что модель неправильно оценила важность информации (ranking errors), а тем, что информация была удалена из окна памяти (eviction). Это означает, что проблема не в «интеллекте» выбора, а в физическом ограничении объема хранилища.

Влияние типа данных

Повторение оценки на датасете SQuAD подтвердило наличие «потолка удержания» (retention ceiling). Однако тип данных играет роль: на естественном тексте плотный поиск (dense retrieval) превзошел лексический поиск, тогда как в структурированных условиях разница могла быть иной. Это указывает на то, что архитектура памяти должна адаптироваться под тип входящих данных.

Рекомендации для индустрии

Авторы настаивают на изменении стандартов оценки: bounded-memory evaluations должны фиксировать доступ к истории и отчетливо разделять метрики удержания и выборки. Без этого мы рискуем инвестировать в оптимизацию поиска, тогда как реальная проблема кроется в алгоритмах вытеснения информации из контекстного окна.

Источник: arXiv cs.AI ↗