Исследования12 августа 2026 г., 10:17 МСК🤖 Auto

MESA: Адаптивная память для агентов с приростом точности 8,5%

Исследователи представили MESA — систему динамического выбора доказательств для долгосрочной памяти AI-агентов, которая повышает точность ответов и снижает затраты токенов.

Баннер новости 5591

Проблема «шума» в долгосрочной памяти

Агенты с длинным горизонтом планирования (long-horizon agents) накапливают огромные объемы данных, где ответ на текущий запрос может зависеть от событий, произошедших сотни шагов назад. Существующие подходы к хранению такой информации имеют два критических недостатка: либо они загружают в контекст все структуры памяти сразу, что создает шум и перегружает модель, либо маршрутизируют запрос в одну структуру, лишая агента возможности комбинировать разрозненные факты.

Решение MESA: Динамический отбор

Команда авторов (Beidi Zhao и соавт.) разработала фреймворк MESA (Multi-structure Evidence Selection). Его суть заключается в том, что система не использует фиксированный набор памяти. Вместо этого она обучается выбирать и объединять только те подмножества из пяти комплементарных структур памяти, которые релевантны конкретному запросу. Обучение происходит через обратную связь на уровне итогового ответа (end-to-end answer-level feedback), что позволяет оптимизировать выбор без жесткой разметки каждого шага.

Метрики и результаты на AMA-Bench

Эксперименты проводились на бенчмарке AMA-Bench. Результаты демонстрируют, что оптимальная конфигурация памяти — это не «все сразу» и не «одно лучшее», а гибридный подход, адаптирующийся под задачу. MESA превосходит сильнейшие базовые модели по точности и значительно экономит ресурсы.

d>Количество структур
Метрика Результат MESA Сравнение с альтернативами
Точность ответа +8.5% Превосходство над лучшим базовым подходом
Использование токенов -41% Экономия по сравнению с загрузкой всех структур памяти
5 Комплементарные виды представлений траектории

Техническая реализация

Для обучения в условиях слабой разметки (weak supervision) MESA использует оптимизацию сHarness, применяя поиск с априорными引导 (prior-guided search) и планирование на основе алгоритма UCB (Upper Confidence Bound). Это позволяет балансировать между исследованием новых комбинаций памяти и использованием проверенных эффективных путей, что критически важно для стабильной работы агентов в сложных сценариях.

Источник: arXiv cs.AI ↗