Исследования29 сентября 2026 г., 13:20 МСК🤖 Auto

Цена размышлений: почему LLM-трейдинг не выигрывает от усиления reasoning

Исследование arXiv:2609.30705 доказывает: увеличение вычислительных затрат на тестовом этапе (test-time reasoning) в LLM не гарантирует роста доходности портфеля, а часто приводит к нестабильным решениям.

Баннер новости 8502

Суть проблемы: стоимость vs польза

Внедрение моделей с расширенным логическим выводом (reasoning) в финансовый сектор обходится дорого. Однако новое исследование авторов Jiayi Chen и Guiling Wang ставит под сомнение экономическую целесообразность таких затрат. Авторы провели контролируемый эксперимент, чтобы ответить на вопрос: «Окупается ли цена размышлений в трейдинге на основе LLM?»

Ключевая гипотеза, которую опровергли ученые, заключается в том, что более «глубокое» мышление модели автоматически приводит к лучшим инвестиционным решениям. На практике увеличение усилий модели (reasoning effort) не привело к надежному улучшению чистой доходности портфеля (net portfolio returns) после вычета торговых издержек.

Методология и масштаб

Эксперимент охватил полный год торгов на рынке акций США. Исследователи использовали репрезентативные модели от трех ключевых игроков рынка: DeepSeek, GPT и Gemini.

Для чистоты эксперимента были зафиксированы:

  • Информация, доступная на дату формирования портфеля;
  • Промпты (подсказки) для моделей;
  • Формат вывода;
  • Методология построения портфеля.

Единственным варьируемым параметром была степень рассуждения модели. Было обработано более 800 000 предсказаний по активам с повторными генерациями для оценки стабильности.

Результаты: нелинейность и хаос

Результаты оказались парадоксальными. Добавление вычислительных ресурсов на этапе тестирования (test-time) не дало стабильного прироста прибыли. Особенно показателен случай с моделью DeepSeek, где авторы изучали полный спектр от полного отсутствия reasoning до максимального уровня.

Модель / Параметр Наблюдаемый эффект на доходность Стабильность решений
DeepSeek (полный спектр) Нелинейная зависимость (nonmonotonic). Улучшения нет, провалы возможны. Низкая: выбор активов меняется при повторных запусках.
GPT & Gemini Отсутствие надежного улучшения net returns. Нестабильные эффекты лечения (treatment effects) даже при схожих общих баллах.
Общий вывод Доп. reasoning меняет финансовые решения, но не их экономическую ценность. Требуется валидация для каждой конкретной задачи перед деплоем.

Почему это важно для индустрии

Исследование выявляет критический риск для финансовых институтов, внедряющих AI: модель может генерировать другие торговые решения, основываясь на «более глубоком» анализе, но эти решения не будут экономически эффективнее базовых. Более того, повторные генерации одних и тех же данных приводят к нестабильному выбору активов, что недопустимо для управления рисками.

Авторы призывают не полагаться на слепое увеличение вычислительных мощностей (compute) для улучшения результатов. Вместо этого необходима строгая валидация каждого use-case, чтобы убедиться, что дополнительные затраты на reasoning действительно конвертируются в прибыль, а не просто в шум.

Источник: arXiv cs.AI ↗