Исследования1 сентября 2026 г., 09:21 МСК🤖 Auto

CrossAudit: Как Git-реестр и кросс-вендорная проверка спасают AI-науку от самообмана

Исследователи представили протокол CrossAudit, исключающий конфликт интересов в AI-науке: каждый шаг автономного агента проверяется моделью от другого вендора, а все решения фиксируются в Git.

Баннер новости 6474

Проблема: AI не должен проверять сам себя

В современных системах автономных исследований (Agentic Science) возникает критический риск: агент, генерирующий результаты, часто проверяется моделью из того же семейства или от того же вендора. Это приводит к системной предвзятости — модели склонны одобрять собственные генерации и разделять одни и те же «слепые зоны». При этом история проверок обычно хранится в закрытых логах платформ, что делает процесс непрозрачным и невозможным для воспроизведения.

Решение: Git-Native Audit Loop

Команда авторов (Zhaohe Dong, Yuhao Chen) предлагает протокол CrossAudit, который переводит аудит AI-агентов в плоскость открытого контроля. Ключевые принципы:

  • Кросс-вендорность: Агенты-аудиторы всегда принадлежат к другому вендору, чем агенты-авторы.
  • Git-реестр: Все отчеты, вердикты, споры и решения фиксируются как коммиты в Git. Это создает неизменяемую историю, которую можно перепроверить и процитировать.
  • Человеческий контроль: Аудиторы работают по «книге правил» (rulebook), написанной человеком. Модель может заблокировать шаг, только сославшись на правило, но не может отменить детерминированный сбой. Если блокировка сохраняется после ограниченного числа попыток исправления, вопрос передается человеку.

Эксперимент: 30 инкрементов, 43 дефекта

Авторы провели тестирование на сценарии с заранее заложенными ошибками (seeded-defect trial). Целью было проверить, насколько эффективно кросс-вендорная проверка выявляет ошибки, которые могли быть пропущены при внутренней проверке.

Параметр Значение / Описание
Количество инкрементов 30
Количество заложенных дефектов 43
Реализация GitHub Actions + Python (несколько сотен строк кода)
Ключевой вывод Разные вендоры по-разному интерпретируют одни и те же правила. Ни один из них не оказался однозначно «лучше», но их совместная работа выявила ошибки.

Почему это важно для AI-индустрии

Самый сильный аргумент в пользу метода — рекурсивность. Авторы применили протокол CrossAudit к самому процессу написания и рецензирования этой статьи. Кросс-вендорный аудит их собственного репозитория «сломал ослепление» (voided its blinding), выявив ошибки, которые были исправлены до публикации.

Это демонстрирует переход от «черного ящика» к верифицируемой науке. В таких областях, как вычислительная химия, где уже запущены пилотные версии протокола, это может стать стандартом для обеспечения достоверности данных, генерируемых ИИ.

Источник: arXiv cs.AI ↗