Исследования25 сентября 2026 г., 17:23 МСК🤖 Auto

Forecast-Dojo: LLM учатся предсказывать события на 1568 кейсах Polymarket

Исследователи представили Forecast-Dojo — первую воспроизводимую среду для обучения и оценки LLM в прогнозировании. Система использует 18.8 млн новостных статей и данные Polymarket, показывая, что поиск снижает ошибку Brier, но рынки всё ещё точнее м

Баннер новости 8276

Проблема статичных бенчмарков

Традиционные методы оценки языковых моделей часто страдают от «утечки данных» или невозможности проверить, как модель обновляет убеждения со временем. Forecast-Dojo решает эту проблему, создавая воспроизводимую среду (replayable environment). Исследователи (команда из 11 авторов во главе с Liqin Ye) объединили завершенные вопросы с прогнозами с платформы Polymarket и датированные новостные статьи. Это позволяет агентам на базе LLM исследовать событие, делать прогноз, а затем «возвращаться» к тем же историческим датам для проверки и обучения без ожидания реального разрешения событий.

Масштаб данных и архитектура

Базовый набор данных включает 1,568 событий с Polymarket, разделенных на обучающие и тестовые периоды, и 18.8 миллионов новостных статей с временными метками. Архитектура позволяет собирать траектории взаимодействия агентов и получать обратную связь от записанных исходов. Это критически важно для Supervised Fine-Tuning (SFT), так как предоставляет качественные данные для дообучения моделей на основе реальных результатов прогнозов.

Результаты тестирования 12 моделей

Авторы протестировали 12 различных LLM. Ключевые выводы:

  • Эффективность поиска: Использование инструментов исследования (research tools) снизило ошибку Брайера (Brier score) для всех 12 протестированных моделей.
  • Динамика улучшений: Прогнозы становились точнее по мере развертывания событий. Наибольший прирост точности наблюдался на этапах, где появлялось больше новых доказательств.
  • «Блокнот убеждений»: Механизм передачи «notebook» с убеждениями между датами снизил затраты на исследование, но не обеспечил стабильного улучшения качества прогнозов.
Метрика / Параметр Результат / Наблюдение
Количество событий 1,568 (Polymarket)
Объем новостных данных 18.8 млн датированных статей
Влияние поиска на Brier score Снижение ошибки для всех 12 моделей
Сравнение с рынком Все LLM уступают историческим прогнозам рынка по точности и Brier score
Эффект «Блокнота убеждений» Снижает затраты, но не улучшает качество прогнозов стабильно

Почему это важно

Forecast-Dojo демонстрирует, что хотя LLM могут учиться на исторических данных и улучшать свои прогнозы через поиск, они пока не способны превзойти агрегированную мудрость предсказательных рынков. Однако возможность воспроизводить сценарии открывает путь к созданию более эффективных агентов для финансового и политического прогнозирования, где скорость реакции на новые данные критична.

Источник: arXiv cs.AI ↗