Проблема «шума» в долгосрочной памяти
Агенты с длинным горизонтом планирования (long-horizon agents) накапливают огромные объемы данных, где ответ на текущий запрос может зависеть от событий, произошедших сотни шагов назад. Существующие подходы к хранению такой информации имеют два критических недостатка: либо они загружают в контекст все структуры памяти сразу, что создает шум и перегружает модель, либо маршрутизируют запрос в одну структуру, лишая агента возможности комбинировать разрозненные факты.
Решение MESA: Динамический отбор
Команда авторов (Beidi Zhao и соавт.) разработала фреймворк MESA (Multi-structure Evidence Selection). Его суть заключается в том, что система не использует фиксированный набор памяти. Вместо этого она обучается выбирать и объединять только те подмножества из пяти комплементарных структур памяти, которые релевантны конкретному запросу. Обучение происходит через обратную связь на уровне итогового ответа (end-to-end answer-level feedback), что позволяет оптимизировать выбор без жесткой разметки каждого шага.
Метрики и результаты на AMA-Bench
Эксперименты проводились на бенчмарке AMA-Bench. Результаты демонстрируют, что оптимальная конфигурация памяти — это не «все сразу» и не «одно лучшее», а гибридный подход, адаптирующийся под задачу. MESA превосходит сильнейшие базовые модели по точности и значительно экономит ресурсы.
| Метрика | Результат MESA | Сравнение с альтернативами |
|---|---|---|
| Точность ответа | +8.5% | Превосходство над лучшим базовым подходом |
| Использование токенов | -41% | Экономия по сравнению с загрузкой всех структур памяти |
| 5 | Комплементарные виды представлений траектории |
Техническая реализация
Для обучения в условиях слабой разметки (weak supervision) MESA использует оптимизацию сHarness, применяя поиск с априорными引导 (prior-guided search) и планирование на основе алгоритма UCB (Upper Confidence Bound). Это позволяет балансировать между исследованием новых комбинаций памяти и использованием проверенных эффективных путей, что критически важно для стабильной работы агентов в сложных сценариях.
Источник: arXiv cs.AI ↗
