Исследования3 июля 2026 г., 21:45 МСК🤖 Auto

Thinking Machines: Как обучить LLM инвестиционному чутью лучше GPT и Claude

Лаборатория Thinking Machines показала, что промпт-инжиниринг не спасает фронтьер-модели от ошибок в финансах. Их кастомная модель на базе Qwen3-235B превзошла GPT-5.4 и Claude по точности фильтрации информации, затратив в разы меньше средств.

Баннер новости 2875

Проблема: «Инвестиционное чутье» не передается через промпты

Инвесторы ежедневно обрабатывают тонны данных: новости, отчеты ЦБ, внутренние мемы. Главная задача — не чтение, а триаж информации: отсечение шума и выделение сигнала. Это интуитивный процесс, основанный на опыте, который трудно формализовать.

Thinking Machines решили автоматизировать этот процесс. Они протестировали передовые модели (GPT-5.4, GPT-5.5, Claude Opus 4.6/4.8, Gemini 3.1 Pro) на шести задачах фильтрации финансовых документов. Результат оказался удручающим: даже с экспертно написанными промптами средняя точность фронтьер-моделей составила лишь ~78%, что ниже порога доверия профессионалов (80%).

Детали эксперимента: 6 задач и провал базовых моделей

Исследование охватывало реальные рабочие процессы инвесторов. Модели должны были классифицировать релевантность статей, определять направление ставок ЦБ, находить «сухую» часть документов и обрезать email-переписку.

Задача Суть Метрика
Релевантность статьи Относятся ли новости к интересам C-level инвестора F1, Accuracy
Документы ЦБ Сигнализируют ли документы о будущем изменении ставок F1, Accuracy
Generic Document Отвечает ли документ на конкретный вопрос инвестора F1, Accuracy
Ad Hoc Labeling Разделение на «шаблон» и уникальный анализ, поиск последней страницы с уникальным контентом Accuracy
Document Truncation Определение точки, где начинается шаблонный текст в документе Exact Match
Email Truncation Аналогично, но для электронной переписки Exact Match

Почему промпты не сработали

Базовые промпты давали точность на уровне монетки (~47-50%). Эксперты переформулировали задачи (например, разделив новости на «релевантные и интересные» и «релевантные, но скучные»), что подняло метрику до 74-78%. Однако автоматическая оптимизация промптов (prompt-optimization) не дала дальнейшего роста. Модель GPT-5.4, которая на 43% дороже предыдущей версии, показала лишь маргинальное улучшение, что делает её использование экономически нецелесообразным для таких задач.

Решение Thinking Machines: Обучение на «чистых» данных

Компания создала собственную модель на базе Qwen3-235B, используя фреймворк Tinker и алгоритм GRPO (Group Relative Policy Optimization). Ключевой инновацией стала методология сбора данных:

  1. Первичная разметка не-экспертами (дешево, но шумно).
  2. Обучение черновой модели на этих данных.
  3. Верификация: эксперты проверяли только те примеры, где черновая модель ошибалась или сомневалась. Это позволило отфильтровать неверные лейблы и сохранить «вкус» эксперта.

Такой подход позволил модели развить собственное «суждение», не ограничиваясь тем, что можно выразить словами в промпте. Итоговая модель превзошла все протестированные фронтьер-аналоги по точности и полноте (recall), обойдя их по стоимости обработки 1000 задач.

Вывод: Эра дифференцированного интеллекта

Thinking Machines демонстрируют, что для узкоспециализированных финансовых задач «больше параметров» не всегда значит «лучше». Кастомная дообученная модель, обученная на качественных экспертных решениях, оказывается эффективнее универсальных LLM, которые борются с нехваткой контекста и «шумом» в промптах. Это шаг к созданию «дифференцированного интеллекта» — моделей, заточенных под конкретные нужды организации.

Источник: Thinkingmachines ↗