Исследования6 августа 2026 г., 08:16 МСК🤖 Auto

FinPerMA: Почему LLM-агенты проваливают тесты на персонализацию

Новый бенчмарк FinPerMA показал, что даже топовые LLM не умеют адаптироваться к изменениям в предпочтениях пользователей. Точность персонализации не превышает 39%.

Баннер новости 5186

Проблема долгосрочной памяти в финансовых агентах

Крупные языковые модели (LLM) всё чаще используются в качестве персональных финансовых советников. Однако ключевая проблема остаётся нерешённой: агенты не способны эффективно поддерживать и обновлять индивидуальную модель пользователя на длительных временных горизонтах. Существующие бенчмарки проверяли лишь фактологическую память или использовали слабо контролируемые сценарии, игнорируя адаптацию предпочтений после реальных событий.

Что такое FinPerMA

Исследователи во главе с Беном Вангом (Ben Wang) представили FinPerMA — первый бенчмарк, основанный на теоретических моделях и привязанный к конкретным событиям. Методология оценивает способность агента интегрировать существенные изменения в портфель пользователя. Генерация данных включает детерминированные правила влияния, контролируемое повествование LLM и автоматическую проверку качества. Ключевой этап — Post-Shock checkpoint — проверяет, усвоил ли агент «шок» (резкое изменение ситуации) и обновил ли он постоянную модель пользователя.

Результаты тестирования: цифры и провалы

Тестирование проводилось на 2 994 вопросах от 276 персон. В сравнении участвовали семь передовых LLM с различными конфигурациями памяти. Результаты оказались катастрофически низкими для коммерческого применения:

Метрика Результат Комментарий
Общая точность (Overall Accuracy) ~0.47 Ни одна конфигурация не преодолела этот порог
Точность Multiple-Choice ~39% Критически низкий уровень для финансовых рекомендаций
Количество персон 276 Разнообразные профили инвесторов
Количество вопросов 2 994 Строгий объем выборки

Почему простая память лучше сложных систем

Анализ атрибуции выявил парадокс: системы, основанные на суммаризации (summary-based memory), часто сохраняют фактические детали, но теряют сигналы предпочтений, необходимые для персонализации. В результате простое извлечение информации (simple retrieval) часто превосходит специально разработанные системы памяти. Разрыв в эффективности между простыми и сложными методами памяти увеличивается именно после наступления «шоковых» событий.

Значение для индустрии

Исследование показывает, что текущие архитектуры LLM-агентов далеки от насыщения в задачах долгосрочной персонализации. Для создания надежных финансовых помощников необходимо пересмотреть подходы к хранению не только фактов, но и динамических предпочтений пользователей, особенно в периоды рыночных потрясений.

Источник: arXiv cs.AI ↗