Исследования9 сентября 2026 г., 18:18 МСК🤖 Auto

Боты догнали экспертов: результаты FutureEval Spring 2026

В весеннем турнире прогнозирования Metaculus команда ИИ-ботов сократила отставание от профессиональных прогнозистов до статистически незначимой разницы в 1.25 балла. Лидером среди моделей стал GPT-5.4.

Суть события

В период с 7 января по 15 апреля 2026 года платформа Metaculus провела пятый сезон турнира FutureEval. В соревновании участвовали 173 ИИ-бота (111 внешних разработчиков и 65 внутренних «Metac Bots») и команда из 10 профессиональных прогнозистов (Pro Forecasters). Боты оценивались на 297 вопросах, охватывающих экономику, геополитику, технологии и спорт. Команда экспертов давала прогнозы на 99 из этих вопросов, что позволило провести прямое сравнение.

Ключевые цифры: разрыв почти исчез

Главный вывод исследования — ИИ-системы достигли паритета с лучшими человеческими аналитиками. Хотя команда Pros в среднем опередила топ-10 ботов на 1.25 балла за вопрос, эта разница не является статистически значимой (p = 0.247). Это означает, что в текущих условиях человеческий фактор больше не дает гарантированного преимущества в точности прогнозов.

Динамика отставания ботов за последние два года демонстрирует стремительный прогресс:

Период Счет ботов (vs Pros) 95% доверительный интервал Комментарий
Q3 2024 -11.3 [-21.8, -0.7] Значимое отставание
Q4 2024 -8.9 [-18.8, 1] Сокращение разрыва
Q1 2025 -17.7 [-28.3, -7.0] Всплеск отставания
Q2 2025 -20.03 [-28.63, -11.41] Пик отставания
Spring 2026 -1.25 [-4.87, 2.37] Разрыв статистически равен нулю

Технологический стек победителей

Анализ показал, что использование передовых моделей критически важно. Лучший результат среди ботов, использующих одинаковый промпт, показала система на базе OpenAI GPT-5.1-high, занявшая 18-е место в общем зачете. Однако опрос разработчиков выявил более глубокую тенденцию: 9 из 10 топ-разработчиков использовали в своих ансамблях модель GPT-5.4. Статистический анализ подтвердил, что использование именно GPT-5.4 является самым сильным предиктором высокой оценки бота.

Также отмечено улучшение «агентных» архитектур. Если раньше базовые боты без сложной логики занимали верхние строчки, то в этом сезоне лучший базовый бот (на базе GPT 5.1) занял лишь 18-е место из 173. Это свидетельствует о том, что сами по себе LLM стали настолько сильными, что простое наличие агентной оболочки больше не дает такого преимущества, как раньше.

Парадокс ансамблей и роль человека

Интересный вывод касается агрегации прогнозов. Команда ботов достигла пика эффективности при объединении 10 моделей. Увеличение размера ансамбля свыше 10 ботов привело к снижению качества прогнозов, что опровергает миф о том, что «больше моделей = лучше результат».

При этом индивидуальные результаты показали, что 9 из 10 лучших прогнозистов турнира — люди. Лишь два бота смогли обойти одного из экспертов. Однако авторы исследования предупреждают, что в индивидуальных сравнениях высока роль случайности, поэтому командное сравнение (Team vs Team) считается более надежным индикатором истинного уровня развития ИИ.

Вывод для индустрии

Результаты FutureEval Spring 2026 сигнализируют о конце эры «легких очков» для ИИ. Разница между лучшим ИИ и лучшим человеком в задачах вероятностного прогнозирования практически стерта. Для разработчиков это означает, что конкурентное преимущество теперь зависит не от выбора базовой модели (все топы используют GPT-5.x), а от тонкой настройки ансамблей, поиска и архитектуры агентов.

Источник: LessWrong ↗