Исследования2 октября 2026 г., 12:17 МСК🤖 Auto

AI-агенты не улучшают прогнозы: исследование Predictive Credit

Масштабное исследование показало, что научные объяснения от AI-агентов не повышают точность прогнозов. В то время как DeepSeek V4 Pro снизил дрейф данных, базовые модели не смогли доказать свою ценность перед простыми описаниями.

Баннер новости 8770

Суть эксперимента: «Кредит предсказания»

Исследователи из команды Jingjie Ning, Xueqi Li и коллег провели строгий анализ под названием Predictive Credit. Цель — измерить, действительно ли добавление научного объяснения к прогнозу улучшает его точность. Тестирование проводилось на 336 проспективных состояниях, 12 конечных точках Tox21 (токсикология) и 24 задачах OpenML. Ключевая метрика — сравнение прогнозов с одинаковым вмешательством, но разным уровнем описания и объяснения.

Результаты: Гипотеза не подтвердилась

Основной вывод исследования пессимистичен для индустрии AI-агентов: прирост предсказательной силы от объяснений не был подтвержден. В большинстве случаев добавление «карточки» с объяснением не давало статистически значимого улучшения по сравнению с простым описанием задачи. Более того, в некоторых сценариях точность даже снижалась.

Особое внимание уделено модели DeepSeek V4 Flash. При повторном запуске (replay) модель показала ухудшение метрики MAE (средняя абсолютная ошибка) с 0.01823 до 0.02020. Также не удалось достичь эквивалентности интервальных оценок между сгруппированными и донорскими картами.

Исключения и нюансы: Когда объяснение работает

Несмотря на общий негативный результат, есть важные нюансы. Использование модели DeepSeek V4 Pro в режиме «замороженного кредитного решения» показало эффективность в снижении вторичного дрейфа данных (secondary drift) на 64.5% (для matched cards) и 59.1% (для donor cards). Также человеческий фактор оказался сильнее: объяснение, составленное исследователем (human-authored mechanism), снизило точечную MAE на 2.60 процентных пункта по сравнению с простым описанием.

Статистика покрытия интервалов

Исследование также выявило проблемы с калибровкой неопределенности. При полном назначении карт (full-card assignment) номинальные 80-процентные интервалы расширились на 21%, а покрытие (coverage) составило всего 49.3% против 51.4% у простых описаний. Это указывает на то, что сложные объяснения могут вносить шум, а не ясность.

Метрика / Модель Результат Значение
DeepSeek V4 Pro (снижение дрейфа) Matched cards -64.5%
DeepSeek V4 Pro (снижение дрейфа) Donor cards -59.1%
DeepSeek V4 Flash (MAE) Рост ошибки 0.01823 → 0.02020
Человеческое объяснение (MAE) Снижение ошибки -2.60 п.п.
Покрытие интервалов (OpenML) Full-card vs Description 49.3% vs 51.4%

Почему это важно

Результаты ставят под сомнение тренд на внедрение AI-агентов, которые генерируют «объяснимые» прогнозы для научных открытий. Если объяснение не улучшает точность, а иногда и ухудшает калибровку неопределенности, то ценность таких систем для критических задач (например, в фармацевтике или климатическом моделировании) требует пересмотра. Исследование подчеркивает, что «естественно-научный кредит» (natural-explanation credit) при текущих разрешениях доноров остается неподтвержденным.

Источник: arXiv cs.AI ↗