Проблема статичных бенчмарков
Традиционные методы оценки языковых моделей часто страдают от «утечки данных» или невозможности проверить, как модель обновляет убеждения со временем. Forecast-Dojo решает эту проблему, создавая воспроизводимую среду (replayable environment). Исследователи (команда из 11 авторов во главе с Liqin Ye) объединили завершенные вопросы с прогнозами с платформы Polymarket и датированные новостные статьи. Это позволяет агентам на базе LLM исследовать событие, делать прогноз, а затем «возвращаться» к тем же историческим датам для проверки и обучения без ожидания реального разрешения событий.
Масштаб данных и архитектура
Базовый набор данных включает 1,568 событий с Polymarket, разделенных на обучающие и тестовые периоды, и 18.8 миллионов новостных статей с временными метками. Архитектура позволяет собирать траектории взаимодействия агентов и получать обратную связь от записанных исходов. Это критически важно для Supervised Fine-Tuning (SFT), так как предоставляет качественные данные для дообучения моделей на основе реальных результатов прогнозов.
Результаты тестирования 12 моделей
Авторы протестировали 12 различных LLM. Ключевые выводы:
- Эффективность поиска: Использование инструментов исследования (research tools) снизило ошибку Брайера (Brier score) для всех 12 протестированных моделей.
- Динамика улучшений: Прогнозы становились точнее по мере развертывания событий. Наибольший прирост точности наблюдался на этапах, где появлялось больше новых доказательств.
- «Блокнот убеждений»: Механизм передачи «notebook» с убеждениями между датами снизил затраты на исследование, но не обеспечил стабильного улучшения качества прогнозов.
| Метрика / Параметр | Результат / Наблюдение |
|---|---|
| Количество событий | 1,568 (Polymarket) |
| Объем новостных данных | 18.8 млн датированных статей |
| Влияние поиска на Brier score | Снижение ошибки для всех 12 моделей |
| Сравнение с рынком | Все LLM уступают историческим прогнозам рынка по точности и Brier score |
| Эффект «Блокнота убеждений» | Снижает затраты, но не улучшает качество прогнозов стабильно |
Почему это важно
Forecast-Dojo демонстрирует, что хотя LLM могут учиться на исторических данных и улучшать свои прогнозы через поиск, они пока не способны превзойти агрегированную мудрость предсказательных рынков. Однако возможность воспроизводить сценарии открывает путь к созданию более эффективных агентов для финансового и политического прогнозирования, где скорость реакции на новые данные критична.
Источник: arXiv cs.AI ↗
