Проблема «слепой зоны» в оценке моделей
В машинном обучении для причинного вывода (causal inference) стандартом оценки качества nuisance-функций (вспомогательных моделей, предсказывающих воздействие и исход) является метрика ошибки прогноза, например, RMSE. Однако новое исследование, опубликованное в arXiv (2026), ставит под сомнение эту парадигму. Автор Cong Cao демонстрирует, что модель, имеющая наименьшую ошибку предсказания, не всегда обеспечивает наилучшую оценку причинно-следственного эффекта или корректность доверительных интервалов.
Методология и сравнение моделей
Исследование проведено с использованием метода Монте-Карло на частично линейных моделях. Авторы сравнили четыре подхода:
- Обычный метод наименьших квадратов (OLS).
- Обобщенные аддитивные модели (GAM).
- XGBoost.
- Double Machine Learning с XGBoost (DML-XGBoost).
Ключевые метрики оценки включали bias (смещение), RMSE, а также покрытие 95% доверительных интервалов (coverage). Также был протестирован простой показатель совместной ошибки (joint-error), основанный на абсолютном произведении ошибок предсказания воздействия и исхода.
Ключевые результаты
Результаты показали разрыв между качеством прогноза и качеством каузального вывода. XGBoost показал наименьший RMSE среди небайесовских методов, однако DML-XGBoost обеспечил лучшее покрытие доверительных интервалов. Простая метрика совместной ошибки показала слабую корреляцию с каузальным смещением.
| Метод | RMSE (точность прогноза) | Покрытие 95% CI (надежность вывода) | Вывод для каузального анализа |
|---|---|---|---|
| XGBoost | Наименьший (лучший) | Не всегда оптимальный | Хорош для предсказания, но не гарантирует точность эффекта |
| DML-XGBoost | Выше, чем у XGBoost | Наилучшее (общий лидер) | Оптимальный баланс для оценки причинных связей |
| OLS / GAM | Выше, чем у ансамблей | Зависит от спецификации | Требуют строгой спецификации модели |
Почему это важно для AI-индустрии
Для специалистов по Data Science и ML-инженеров, работающих в сферах медицины, экономики или A/B-тестирования, это исследование означает необходимость пересмотра метрик валидации. Оптимизация модели только по метрикам точности прогноза (Accuracy, RMSE, MAE) может привести к ошибочным бизнес-решениям, если цель — оценка эффекта вмешательства. Доверительные интервалы и специализированные каузальные метрики должны быть приоритетнее «сырой» точности прогноза.
Источник: arXiv cs.AI ↗
