Суть события
В период с 7 января по 15 апреля 2026 года платформа Metaculus провела пятый сезон турнира FutureEval. В соревновании участвовали 173 ИИ-бота (111 внешних разработчиков и 65 внутренних «Metac Bots») и команда из 10 профессиональных прогнозистов (Pro Forecasters). Боты оценивались на 297 вопросах, охватывающих экономику, геополитику, технологии и спорт. Команда экспертов давала прогнозы на 99 из этих вопросов, что позволило провести прямое сравнение.
Ключевые цифры: разрыв почти исчез
Главный вывод исследования — ИИ-системы достигли паритета с лучшими человеческими аналитиками. Хотя команда Pros в среднем опередила топ-10 ботов на 1.25 балла за вопрос, эта разница не является статистически значимой (p = 0.247). Это означает, что в текущих условиях человеческий фактор больше не дает гарантированного преимущества в точности прогнозов.
Динамика отставания ботов за последние два года демонстрирует стремительный прогресс:
| Период | Счет ботов (vs Pros) | 95% доверительный интервал | Комментарий |
|---|---|---|---|
| Q3 2024 | -11.3 | [-21.8, -0.7] | Значимое отставание |
| Q4 2024 | -8.9 | [-18.8, 1] | Сокращение разрыва |
| Q1 2025 | -17.7 | [-28.3, -7.0] | Всплеск отставания |
| Q2 2025 | -20.03 | [-28.63, -11.41] | Пик отставания |
| Spring 2026 | -1.25 | [-4.87, 2.37] | Разрыв статистически равен нулю |
Технологический стек победителей
Анализ показал, что использование передовых моделей критически важно. Лучший результат среди ботов, использующих одинаковый промпт, показала система на базе OpenAI GPT-5.1-high, занявшая 18-е место в общем зачете. Однако опрос разработчиков выявил более глубокую тенденцию: 9 из 10 топ-разработчиков использовали в своих ансамблях модель GPT-5.4. Статистический анализ подтвердил, что использование именно GPT-5.4 является самым сильным предиктором высокой оценки бота.
Также отмечено улучшение «агентных» архитектур. Если раньше базовые боты без сложной логики занимали верхние строчки, то в этом сезоне лучший базовый бот (на базе GPT 5.1) занял лишь 18-е место из 173. Это свидетельствует о том, что сами по себе LLM стали настолько сильными, что простое наличие агентной оболочки больше не дает такого преимущества, как раньше.
Парадокс ансамблей и роль человека
Интересный вывод касается агрегации прогнозов. Команда ботов достигла пика эффективности при объединении 10 моделей. Увеличение размера ансамбля свыше 10 ботов привело к снижению качества прогнозов, что опровергает миф о том, что «больше моделей = лучше результат».
При этом индивидуальные результаты показали, что 9 из 10 лучших прогнозистов турнира — люди. Лишь два бота смогли обойти одного из экспертов. Однако авторы исследования предупреждают, что в индивидуальных сравнениях высока роль случайности, поэтому командное сравнение (Team vs Team) считается более надежным индикатором истинного уровня развития ИИ.
Вывод для индустрии
Результаты FutureEval Spring 2026 сигнализируют о конце эры «легких очков» для ИИ. Разница между лучшим ИИ и лучшим человеком в задачах вероятностного прогнозирования практически стерта. Для разработчиков это означает, что конкурентное преимущество теперь зависит не от выбора базовой модели (все топы используют GPT-5.x), а от тонкой настройки ансамблей, поиска и архитектуры агентов.
Источник: LessWrong ↗