Исследования17 сентября 2026 г., 07:20 МСК🤖 Auto

EvolveTrade: LLM-агенты, которые учатся на ошибках и улучшают Sharpe Ratio

Исследователи представили EvolveTrade — фреймворк, позволяющий LLM-трейдерам самостоятельно эволюционировать, адаптируя системные промпты на основе накопленного опыта и обратной связи от портфеля.

Баннер новости 7687

Проблема статических промптов

Современные LLM-агенты для трейдинга часто используют статические, заранее написанные политики использования инструментов (tool-use policies). Это означает, что алгоритм сбора данных, проверки сигналов и управления рисками фиксируется до начала торгов. В условиях меняющихся рыночных режимов такая жесткость ограничивает способность агента адаптироваться, что приводит к субоптимальным решениям.

Решение: Self-Evolving Framework

Команда авторов (Sehee Kim, Yumin Choi, Minki Kang, Sung Ju Hwang) предложила систему EvolveTrade, где системный промпт рассматривается как параметризуемая текстом политика. Ключевая инновация заключается в следующем:

  • Фиксация модели: Базовая LLM остается неизменной, что предотвращает дрейф знаний и обеспечивает стабильность.
  • Эволюция политики: Отдельный «Policy Agent» пересматривает системный промпт после каждого интервала обновления.
  • Обратная связь: Адаптация происходит на основе накопленных траекторий принятия решений (decision traces) и реальной доходности портфеля (realized portfolio feedback).

Результаты и метрики

Эксперименты проводились в различных рыночных режимах с использованием двух разных LLM-бэкендов. EvolveTrade демонстрирует устойчивое превосходство над базовыми моделями с фиксированной политикой. Основные улучшения зафиксированы по двум ключевым метрикам:

Метрика Результат EvolveTrade Сравнение с базой
Sharpe Ratio (SR) Улучшено Превосходство в большинстве настроек
Cumulative Return (CR) Улучшено Превосходство в большинстве настроек

Поведенческий анализ

Анализ показал, что эволюционирующие политики приводят к качественным изменениям в работе агента:

  • Рост кодовой аналитики: Агенты начинают чаще использовать код для анализа данных, а не только текстовые рассуждения.
  • Релевантные вычисления: Активируются вычислительные паттерны, специфичные для текущего рыночного режима.
  • Атрибуция доходности: Исследователи смогли проследить, как именно изменения в политике (allocation changes) влияют на разницу в реализованной доходности.

Значение для индустрии

Работа EvolveTrade доказывает, что адаптация процедуры использования инструментов (reusable procedure governing tool use) является критически важным направлением. Это шаг от статических ботов к самообучающимся агентам, способным выживать в нестабильных рынках за счет непрерывной оптимизации своих «инструкций» на основе реального опыта.

Источник: arXiv cs.AI ↗