Исследования3 июля 2026 г., 14:19 МСК🤖 Auto

AI-агенты воспроизводят 72% идеологического разрыва ученых: проблема «садов расходящихся путей»

Исследование показывает, что AI-агенты, получая одни и те же данные, могут делать противоположные выводы в зависимости от заданной «персоны». Это подтверждает теорию о том, что главная угроза научной достоверности — не ошибки, а выборочное представле

Баннер новости 2847

Суть проблемы: «Сады расходящихся путей»

В эмпирических исследованиях редко существует единственный правильный способ анализа данных. Различные аналитические решения, принятые исследователями, могут привести к совершенно разным выводам из одного набора данных. Эта проблема известна как «сады расходящихся путей» (Garden of Forking Paths). Авторы работы из Стэнфорда (Jiacheng Miao, Jonathan K. Pritchard, James Zou) доказали, что AI-агенты не просто копируют человеческие ошибки, а делают скрытые пути анализа явными и масштабируемыми.

Ключевые цифры и результаты

Исследователи провели сравнительный анализ, где 42 человеческие команды изучали один и тот же набор данных об иммиграции. Затем те же данные были переданы AI-агентам с разными «персонами» (идеологическими установками). Результаты оказались шокирующими:

  • 72% идеологического разрыва в оценках эффектов, зафиксированного между человеческими командами, было воспроизведено AI-агентами.
  • AI-агенты сообщали о расходящихся, часто противоположных выводах, систематически совпадающих с их заданной «персоной».
  • Несмотря на противоположные выводы, 86% отчетов AI прошли независимую проверку другими AI-агентами, а 78% — большинство экспертов-людей.

Это означает, что сами по себе отчеты AI не содержат явных методологических ошибок. Проблема в том, что из огромного пространства методически обоснованных анализов выбирается только один, наиболее удобный для подтверждения гипотезы.

Новая метрика: m-value (multiverse value)

Для решения этой проблемы авторы предлагают новую метрику — m-value. Это вероятность того, что путь анализа произведет утверждение, как минимум столь же экстремальное, как сообщенное. Если m-value мало, значит, результат — это «выборка» из редких, экстремальных вариантов, а не устойчивый факт.

Авторы также представили метод Agentic Bootstrap, который использует AI-агентов для выборки правдоподобных путей анализа и оценки m-value. Применение этого метода к человеческому исследованию иммиграции показало, что 13.5% опубликованных человеческих анализов попали в самые экстремальные 5% пространства анализов (m < 0.05). Это ставит под сомнение надежность таких результатов.

Почему это важно для науки и индустрии

AI-агенты делают исследование «расходящихся путей» дешевым и масштабируемым. Раньше проверка устойчивости результата требовала ручного труда множества исследователей. Теперь AI может мгновенно сгенерировать сотни вариантов анализа. Это требует пересмотра стандартов научной достоверности: доказательство должно оцениваться не по одному отчету, а по его положению в распределении всех возможных разумных анализов. Agentic Bootstrap делает это распределение наблюдаемым и превращает его в критерий достоверности.

Источник: arXiv cs.AI ↗