Исследования30 июля 2026 г., 01:17 МСК🤖 Auto

Почему лучший предиктивный модель дает неверный эффект лечения

Стандартные методы отбора переменных (BIC, Lasso, BMA) оптимизируют предсказуемость, а не каузальность. Это приводит к систематической ошибке, если упустить конфаундер, слабо влияющий на исход, но сильно связанный с воздействием.

Баннер новости 4670

Ловушка оптимизации предсказуемости

Ключевая проблема заключается в том, что инструменты выбора моделей (stepwise, BIC, cross-validated Lasso) оптимизируют предиктивную точность, а не оценку причинно-следственного эффекта. Модель может идеально предсказывать исход, но быть систематически ошибочной в оценке эффекта воздействия (exposure), если она не учитывает все необходимые конфаундеры.

Это явление, названное Ч. Вангом и соавторами (2012) как "adjustment uncertainty" (неопределенность настройки), возникает, когда конфаундер сильно связан с воздействием, но слабо — с исходом. Для предиктивной модели такая переменная выглядит как «шум», так как объясняет мало дисперсии исхода. Однако исключение её приводит к смещению оценки эффекта.

Демонстрация ошибки на Python

Авторы приводят симуляцию с 1000 наблюдений и 5 кандидатами в ковариаты (U1-U5). Истинный эффект воздействия равен 0.1. Переменная U2 является истинным конфаундером, но в модели исхода её t-статистика составляет всего 1.2 (p=0.23), что заставляет алгоритмы отбора её отбросить.

Модель Оценка эффекта (β̂) 95% ДИ BIC Статус
Полная (U1-U4) 0.144 [0.083, 0.206] 2907.6 Покрывает истину
Без U2 (выбранная по BIC) 0.171 [0.127, 0.214] 2902.1 Ошибка (истина вне ДИ)

Как видно из таблицы, модель, исключившая U2, имеет лучший BIC (2902.1 против 2907.6) и более узкий доверительный интервал. Однако её оценка (0.171) значительно завышает истинный эффект (0.1), а доверительный интервал не покрывает истинное значение. Мы получаем ложную уверенность в статистически значимом, но неверном результате.

Почему Bayesian Model Averaging (BMA) не спасает

Даже усреднение по моделям (BMA) не решает проблему, если веса моделей определяются только маргинальной правдоподобностью (likelihood). В симуляции BMA присваивает ~94% веса модели, которая исключает конфаундер U2. Это происходит потому, что стандартный BMA также опирается на критерии предсказательной способности, игнорируя связь ковариат с воздействием.

Решение: Bayesian Adjustment for Confounding (BAC)

Для исправления ситуации предлагается метод BAC. Его суть в том, чтобы связать выбор переменных через модель воздействия (propensity model). Вводится параметр зависимости ω:

  • ω = 1: Модели независимы (стандартный BMA).
  • ω → ∞: Любая переменная, предсказывающая воздействие, обязательно включается в модель исхода.

При ω → ∞ метод принудительно учитывает все потенциальные конфаундеры, даже если их вклад в дисперсию исхода незначителен. Это устраняет смещение, вызванное упущенными переменными, и возвращает корректную оценку каузального эффекта.

Источник: Towards Data Science ↗