Проблема невидимых причин
Байесовский поиск причинности (Bayesian Causal Discovery) считается золотым стандартом для выявления направленных ациклических графов (DAG), так как позволяет количественно оценить эпистемическую неопределенность. Однако поведение этих моделей при наличии латентных (скрытых) конфаундеров остается «темной материей» науки. Традиционно считается, что скрытые переменные просто нарушают идентифицируемость, но новое исследование arXiv:2607.09449 демонстрирует, что проблема глубже: апостериорное распределение начинает систематически ошибаться, выбирая неверную структуру графа.
Критический порог корреляции
Авторы проанализировали линейные гауссовы причинные модели, сфокусировавшись на аддитивных латентных конфаундерах между двумя наблюдаемыми переменными. Ключевое открытие: существует критический порог корреляции, выше которого функция правдоподобия (score function) начинает отдавать предпочтение графам со фиктивной (spurious) связью между конфаундированными переменными. Это означает, что алгоритм «придумывает» прямую причинную связь там, где её нет, объясняя её наличием скрытой причины.
Парадокс больших данных
Самое тревожное открытие касается объема данных. Исследование показывает, что этот критический порог корреляции снижается с увеличением выборки. Иными словами, чем больше данных вы подаете на вход модели, тем при меньшей силе связи она начинает уверенно выстраивать ложные причинно-следственные связи. Это разрушает интуитивное понимание того, что «больше данных = лучше результат» в контексте байесовского вывода без учета латентных переменных.
Два режима провала
За порогом корреляции апостериорное распределение падает в один из двух режимов провала, которые зависят от локальной структуры графа вокруг конфаундированных переменных. Точные вычисления апостериорных вероятностей на различных структурах графов подтвердили наличие этих режимов, что позволяет предсказывать, когда именно модель даст сбой.
| Параметр | Влияние на ошибку модели |
|---|---|
| Наличие латентного конфаундера | Создает предпосылки для ложных связей между наблюдаемыми переменными |
| Рост объема выборки (N) | Снижает порог корреляции, при котором модель начинает ошибаться |
| Сила корреляции | При превышении порога алгоритм предпочитает фиктивную прямую связь |
| Локальная структура графа | Определяет конкретный режим провала (failure regime) после перехода порога |
Почему это важно
Для исследователей и инженеров, использующих байесовские сети для анализа данных (в медицине, экономике, социологии), это означает, что автоматический поиск причинности без явного учета скрытых переменных может давать ложноположительные результаты, особенно на больших датасетах. Необходимость явного моделирования латентных факторов или использования методов, устойчивых к конфаундингу, становится критической для валидности выводов.
Источник: arXiv cs.AI ↗
