Проблема долгосрочной памяти в финансовых агентах
Крупные языковые модели (LLM) всё чаще используются в качестве персональных финансовых советников. Однако ключевая проблема остаётся нерешённой: агенты не способны эффективно поддерживать и обновлять индивидуальную модель пользователя на длительных временных горизонтах. Существующие бенчмарки проверяли лишь фактологическую память или использовали слабо контролируемые сценарии, игнорируя адаптацию предпочтений после реальных событий.
Что такое FinPerMA
Исследователи во главе с Беном Вангом (Ben Wang) представили FinPerMA — первый бенчмарк, основанный на теоретических моделях и привязанный к конкретным событиям. Методология оценивает способность агента интегрировать существенные изменения в портфель пользователя. Генерация данных включает детерминированные правила влияния, контролируемое повествование LLM и автоматическую проверку качества. Ключевой этап — Post-Shock checkpoint — проверяет, усвоил ли агент «шок» (резкое изменение ситуации) и обновил ли он постоянную модель пользователя.
Результаты тестирования: цифры и провалы
Тестирование проводилось на 2 994 вопросах от 276 персон. В сравнении участвовали семь передовых LLM с различными конфигурациями памяти. Результаты оказались катастрофически низкими для коммерческого применения:
| Метрика | Результат | Комментарий |
|---|---|---|
| Общая точность (Overall Accuracy) | ~0.47 | Ни одна конфигурация не преодолела этот порог |
| Точность Multiple-Choice | ~39% | Критически низкий уровень для финансовых рекомендаций |
| Количество персон | 276 | Разнообразные профили инвесторов |
| Количество вопросов | 2 994 | Строгий объем выборки |
Почему простая память лучше сложных систем
Анализ атрибуции выявил парадокс: системы, основанные на суммаризации (summary-based memory), часто сохраняют фактические детали, но теряют сигналы предпочтений, необходимые для персонализации. В результате простое извлечение информации (simple retrieval) часто превосходит специально разработанные системы памяти. Разрыв в эффективности между простыми и сложными методами памяти увеличивается именно после наступления «шоковых» событий.
Значение для индустрии
Исследование показывает, что текущие архитектуры LLM-агентов далеки от насыщения в задачах долгосрочной персонализации. Для создания надежных финансовых помощников необходимо пересмотреть подходы к хранению не только фактов, но и динамических предпочтений пользователей, особенно в периоды рыночных потрясений.
Источник: arXiv cs.AI ↗
