Суть проблемы: стоимость vs польза
Внедрение моделей с расширенным логическим выводом (reasoning) в финансовый сектор обходится дорого. Однако новое исследование авторов Jiayi Chen и Guiling Wang ставит под сомнение экономическую целесообразность таких затрат. Авторы провели контролируемый эксперимент, чтобы ответить на вопрос: «Окупается ли цена размышлений в трейдинге на основе LLM?»
Ключевая гипотеза, которую опровергли ученые, заключается в том, что более «глубокое» мышление модели автоматически приводит к лучшим инвестиционным решениям. На практике увеличение усилий модели (reasoning effort) не привело к надежному улучшению чистой доходности портфеля (net portfolio returns) после вычета торговых издержек.
Методология и масштаб
Эксперимент охватил полный год торгов на рынке акций США. Исследователи использовали репрезентативные модели от трех ключевых игроков рынка: DeepSeek, GPT и Gemini.
Для чистоты эксперимента были зафиксированы:
- Информация, доступная на дату формирования портфеля;
- Промпты (подсказки) для моделей;
- Формат вывода;
- Методология построения портфеля.
Единственным варьируемым параметром была степень рассуждения модели. Было обработано более 800 000 предсказаний по активам с повторными генерациями для оценки стабильности.
Результаты: нелинейность и хаос
Результаты оказались парадоксальными. Добавление вычислительных ресурсов на этапе тестирования (test-time) не дало стабильного прироста прибыли. Особенно показателен случай с моделью DeepSeek, где авторы изучали полный спектр от полного отсутствия reasoning до максимального уровня.
| Модель / Параметр | Наблюдаемый эффект на доходность | Стабильность решений |
|---|---|---|
| DeepSeek (полный спектр) | Нелинейная зависимость (nonmonotonic). Улучшения нет, провалы возможны. | Низкая: выбор активов меняется при повторных запусках. |
| GPT & Gemini | Отсутствие надежного улучшения net returns. | Нестабильные эффекты лечения (treatment effects) даже при схожих общих баллах. |
| Общий вывод | Доп. reasoning меняет финансовые решения, но не их экономическую ценность. | Требуется валидация для каждой конкретной задачи перед деплоем. |
Почему это важно для индустрии
Исследование выявляет критический риск для финансовых институтов, внедряющих AI: модель может генерировать другие торговые решения, основываясь на «более глубоком» анализе, но эти решения не будут экономически эффективнее базовых. Более того, повторные генерации одних и тех же данных приводят к нестабильному выбору активов, что недопустимо для управления рисками.
Авторы призывают не полагаться на слепое увеличение вычислительных мощностей (compute) для улучшения результатов. Вместо этого необходима строгая валидация каждого use-case, чтобы убедиться, что дополнительные затраты на reasoning действительно конвертируются в прибыль, а не просто в шум.
Источник: arXiv cs.AI ↗
