Исследования1 июля 2026 г., 15:19 МСК🤖 Auto

Первый Foundation Model для управления портфелем с учетом налогов

Исследователь Рамин Пишехвар представил трехфазную систему на базе глубокого обучения, которая решает проблемы «привязки к тикерам» и статичных профилей инвесторов.

Баннер новости 2735

Революция в подходе: от тикеров к универсальным признакам

Традиционные модели финансового RL (reinforcement learning) часто страдают от «ticker lock-in» — они обучаются на конкретных акциях и не могут обобщать знания на новые активы. Новая архитектура решает эту проблему через self-supervised learning на мультиактивном корпусе. Ключевое нововведение — использование Chronos, T5-модели для временных рядов, которая выступает в роли замороженного параллельного ветвления. Ее выводы объединяются с основным энкодером через обучаемый механизм гейтирования (gating mechanism). Это позволяет модели работать с любым публично торгуемым активом, используя всего 50-мерный вектор метаданных, без необходимости дообучения для новых тикеров.

Многозадачность через MoE и PPO

Вторая фаза системы использует Mixture of Experts (MoE) для устранения конфликта градиентов между разными инвестиционными целями. Архитектура включает четыре специализированных эксперта: momentum, growth, defensive и tax-aware. Маршрутизатор (intent router) динамически смешивает их в зависимости от текущей рыночной конъюнктуры и активной цели. Обучение происходит с помощью PPO (Proximal Policy Optimization) с наградой, обусловленной шестью различными целями, которые выбираются случайно в каждом эпизоде:

  • Краткосрочный альфа-доход;
  • Краткосрочная прибыль;
  • Долгосрочная прибыль;
  • Сохранение капитала;
  • Сбор налоговых убытков (tax-loss harvesting);
  • Прибыль только от долгосрочных вложений.

Персонализация через историю сделок, а не анкеты

Третья фаза внедряет слой персонализации, адаптируемый во время инференса. Вместо традиционных опросников система анализирует реальную историю транзакций брокера. Для этого используется легкий модуль LoRA всего из 76 параметров, который дообучается на поведении конкретного пользователя. Дополнительно внедрен парсер естественного языка, который конвертирует свободные текстовые цели инвестора в структурированные параметры.

Сравнение с традиционными подходами

Предложенная архитектура закрывает три ключевых пробела, характерных для всех предыдущих финансовых RL-систем:

Проблема Традиционный подход Решение новой модели
Тикер-привязка Модель обучается под конкретный список акций Универсальный энкодер на 50 метаданных + Chronos
Монолитная цель Оптимизация под один показатель (например, Sharpe ratio) MoE-архитектура с 6 целями и маршрутизацией
Статичный профиль Ручной ввод толерантности к риску LoRA (76 параметров) на основе истории сделок

Работа демонстрирует, что интеграция foundation-моделей для временных рядов в RL-агентов для управления капиталом не только возможна, но и эффективна для создания действительно персонализированных и налогов-оптимизированных стратегий.

Источник: arXiv cs.AI ↗