Исследования2 сентября 2026 г., 09:21 МСК🤖 Auto

Ошибка прогноза ≠ качество каузальной оценки: новые данные

Исследование Cong Cao показывает, что минимизация ошибки предсказания (RMSE) не гарантирует точности каузальных выводов. Лучшие модели для прогнозирования могут давать плохие доверительные интервалы.

Баннер новости 6565

Проблема «слепой зоны» в оценке моделей

В машинном обучении для причинного вывода (causal inference) стандартом оценки качества nuisance-функций (вспомогательных моделей, предсказывающих воздействие и исход) является метрика ошибки прогноза, например, RMSE. Однако новое исследование, опубликованное в arXiv (2026), ставит под сомнение эту парадигму. Автор Cong Cao демонстрирует, что модель, имеющая наименьшую ошибку предсказания, не всегда обеспечивает наилучшую оценку причинно-следственного эффекта или корректность доверительных интервалов.

Методология и сравнение моделей

Исследование проведено с использованием метода Монте-Карло на частично линейных моделях. Авторы сравнили четыре подхода:

  • Обычный метод наименьших квадратов (OLS).
  • Обобщенные аддитивные модели (GAM).
  • XGBoost.
  • Double Machine Learning с XGBoost (DML-XGBoost).

Ключевые метрики оценки включали bias (смещение), RMSE, а также покрытие 95% доверительных интервалов (coverage). Также был протестирован простой показатель совместной ошибки (joint-error), основанный на абсолютном произведении ошибок предсказания воздействия и исхода.

Ключевые результаты

Результаты показали разрыв между качеством прогноза и качеством каузального вывода. XGBoost показал наименьший RMSE среди небайесовских методов, однако DML-XGBoost обеспечил лучшее покрытие доверительных интервалов. Простая метрика совместной ошибки показала слабую корреляцию с каузальным смещением.

Метод RMSE (точность прогноза) Покрытие 95% CI (надежность вывода) Вывод для каузального анализа
XGBoost Наименьший (лучший) Не всегда оптимальный Хорош для предсказания, но не гарантирует точность эффекта
DML-XGBoost Выше, чем у XGBoost Наилучшее (общий лидер) Оптимальный баланс для оценки причинных связей
OLS / GAM Выше, чем у ансамблей Зависит от спецификации Требуют строгой спецификации модели

Почему это важно для AI-индустрии

Для специалистов по Data Science и ML-инженеров, работающих в сферах медицины, экономики или A/B-тестирования, это исследование означает необходимость пересмотра метрик валидации. Оптимизация модели только по метрикам точности прогноза (Accuracy, RMSE, MAE) может привести к ошибочным бизнес-решениям, если цель — оценка эффекта вмешательства. Доверительные интервалы и специализированные каузальные метрики должны быть приоритетнее «сырой» точности прогноза.

Источник: arXiv cs.AI ↗