Проблема: «Инвестиционное чутье» не передается через промпты
Инвесторы ежедневно обрабатывают тонны данных: новости, отчеты ЦБ, внутренние мемы. Главная задача — не чтение, а триаж информации: отсечение шума и выделение сигнала. Это интуитивный процесс, основанный на опыте, который трудно формализовать.
Thinking Machines решили автоматизировать этот процесс. Они протестировали передовые модели (GPT-5.4, GPT-5.5, Claude Opus 4.6/4.8, Gemini 3.1 Pro) на шести задачах фильтрации финансовых документов. Результат оказался удручающим: даже с экспертно написанными промптами средняя точность фронтьер-моделей составила лишь ~78%, что ниже порога доверия профессионалов (80%).
Детали эксперимента: 6 задач и провал базовых моделей
Исследование охватывало реальные рабочие процессы инвесторов. Модели должны были классифицировать релевантность статей, определять направление ставок ЦБ, находить «сухую» часть документов и обрезать email-переписку.
| Задача | Суть | Метрика |
|---|---|---|
| Релевантность статьи | Относятся ли новости к интересам C-level инвестора | F1, Accuracy |
| Документы ЦБ | Сигнализируют ли документы о будущем изменении ставок | F1, Accuracy |
| Generic Document | Отвечает ли документ на конкретный вопрос инвестора | F1, Accuracy |
| Ad Hoc Labeling | Разделение на «шаблон» и уникальный анализ, поиск последней страницы с уникальным контентом | Accuracy |
| Document Truncation | Определение точки, где начинается шаблонный текст в документе | Exact Match |
| Email Truncation | Аналогично, но для электронной переписки | Exact Match |
Почему промпты не сработали
Базовые промпты давали точность на уровне монетки (~47-50%). Эксперты переформулировали задачи (например, разделив новости на «релевантные и интересные» и «релевантные, но скучные»), что подняло метрику до 74-78%. Однако автоматическая оптимизация промптов (prompt-optimization) не дала дальнейшего роста. Модель GPT-5.4, которая на 43% дороже предыдущей версии, показала лишь маргинальное улучшение, что делает её использование экономически нецелесообразным для таких задач.
Решение Thinking Machines: Обучение на «чистых» данных
Компания создала собственную модель на базе Qwen3-235B, используя фреймворк Tinker и алгоритм GRPO (Group Relative Policy Optimization). Ключевой инновацией стала методология сбора данных:
- Первичная разметка не-экспертами (дешево, но шумно).
- Обучение черновой модели на этих данных.
- Верификация: эксперты проверяли только те примеры, где черновая модель ошибалась или сомневалась. Это позволило отфильтровать неверные лейблы и сохранить «вкус» эксперта.
Такой подход позволил модели развить собственное «суждение», не ограничиваясь тем, что можно выразить словами в промпте. Итоговая модель превзошла все протестированные фронтьер-аналоги по точности и полноте (recall), обойдя их по стоимости обработки 1000 задач.
Вывод: Эра дифференцированного интеллекта
Thinking Machines демонстрируют, что для узкоспециализированных финансовых задач «больше параметров» не всегда значит «лучше». Кастомная дообученная модель, обученная на качественных экспертных решениях, оказывается эффективнее универсальных LLM, которые борются с нехваткой контекста и «шумом» в промптах. Это шаг к созданию «дифференцированного интеллекта» — моделей, заточенных под конкретные нужды организации.
Источник: Thinkingmachines ↗
