Ловушка оптимизации предсказуемости
Ключевая проблема заключается в том, что инструменты выбора моделей (stepwise, BIC, cross-validated Lasso) оптимизируют предиктивную точность, а не оценку причинно-следственного эффекта. Модель может идеально предсказывать исход, но быть систематически ошибочной в оценке эффекта воздействия (exposure), если она не учитывает все необходимые конфаундеры.
Это явление, названное Ч. Вангом и соавторами (2012) как "adjustment uncertainty" (неопределенность настройки), возникает, когда конфаундер сильно связан с воздействием, но слабо — с исходом. Для предиктивной модели такая переменная выглядит как «шум», так как объясняет мало дисперсии исхода. Однако исключение её приводит к смещению оценки эффекта.
Демонстрация ошибки на Python
Авторы приводят симуляцию с 1000 наблюдений и 5 кандидатами в ковариаты (U1-U5). Истинный эффект воздействия равен 0.1. Переменная U2 является истинным конфаундером, но в модели исхода её t-статистика составляет всего 1.2 (p=0.23), что заставляет алгоритмы отбора её отбросить.
| Модель | Оценка эффекта (β̂) | 95% ДИ | BIC | Статус |
|---|---|---|---|---|
| Полная (U1-U4) | 0.144 | [0.083, 0.206] | 2907.6 | Покрывает истину |
| Без U2 (выбранная по BIC) | 0.171 | [0.127, 0.214] | 2902.1 | Ошибка (истина вне ДИ) |
Как видно из таблицы, модель, исключившая U2, имеет лучший BIC (2902.1 против 2907.6) и более узкий доверительный интервал. Однако её оценка (0.171) значительно завышает истинный эффект (0.1), а доверительный интервал не покрывает истинное значение. Мы получаем ложную уверенность в статистически значимом, но неверном результате.
Почему Bayesian Model Averaging (BMA) не спасает
Даже усреднение по моделям (BMA) не решает проблему, если веса моделей определяются только маргинальной правдоподобностью (likelihood). В симуляции BMA присваивает ~94% веса модели, которая исключает конфаундер U2. Это происходит потому, что стандартный BMA также опирается на критерии предсказательной способности, игнорируя связь ковариат с воздействием.
Решение: Bayesian Adjustment for Confounding (BAC)
Для исправления ситуации предлагается метод BAC. Его суть в том, чтобы связать выбор переменных через модель воздействия (propensity model). Вводится параметр зависимости ω:
- ω = 1: Модели независимы (стандартный BMA).
- ω → ∞: Любая переменная, предсказывающая воздействие, обязательно включается в модель исхода.
При ω → ∞ метод принудительно учитывает все потенциальные конфаундеры, даже если их вклад в дисперсию исхода незначителен. Это устраняет смещение, вызванное упущенными переменными, и возвращает корректную оценку каузального эффекта.
Источник: Towards Data Science ↗
