Проблема шумной памяти
Управление длинными контекстами остается главным узким местом для LLM-агентов. Избыточная и нерелевантная информация деградирует способность модели к многошаговому рассуждению. Традиционные подходы используют статический поиск или эвристическое затухание, что часто приводит к потере важных связей или, наоборот, к перегрузке контекста шумом.
Решение: Стратегическое забвение
Команда авторов (Ning Yang, Siqi Li и др.) предложила фреймворк SF-AMS (Strategic Forgetting for Agent Memory Systems). В основе лежит механизм выживания, управляемый полезностью (utility-driven), который динамически обновляет важность единиц памяти на основе:
- Избыточности использования: как часто информация востребована.
- Временных сигналов: актуальность данных во времени.
Это формирует иерархическую структуру памяти, где стабильная информация, согласованная с сущностями, приоритизируется, а шум фильтруется. Ключевой компонент — Composite Importance Scoring, интегрирующий семантические и сущностные сигналы для повышения надежности поиска.
Результаты бенчмарков
Эксперименты проводились на наборах данных LoCoMo и LongMemEval-s. SF-AMS демонстрирует стабильное превосходство над сильными базовыми моделями, такими как LightMem, MemO и A-Mem. Наибольший прирост показан в задачах многошагового вывода (multi-hop reasoning) и временного анализа (temporal reasoning).
| Модель / Задача | Метрика | Прирост F1 над лучшим бейзлайном |
|---|---|---|
| Qwen2.5-7B (Multi-hop) | F1 | +9.65 |
| GPT-4o-mini (Temporal) | F1 | +6.91 |
| Open-domain tasks | F1 | +6.53 |
Почему это важно
Результаты демонстрируют сильную кросс-бэкбонную обобщаемость: метод работает эффективно как на открытых моделях (Qwen2.5-7B), так и на закрытых (GPT-4o-mini). Исследование доказывает, что моделирование важности памяти как динамического сигнала полезности критически необходимо для надежного рассуждения в длинных контекстах, открывая путь к более эффективным и «умным» агентам.
Источник: arXiv cs.AI ↗
