Исследования14 августа 2026 г., 23:18 МСК🤖 Auto

ICML 2026: 34% статей не воспроизведены, а AI-агенты нашли ошибки в доказательствах

Hugging Face провела масштабный аудит 2226 статей ICML 2026 с помощью 1200 участников и AI-кодеров. Выяснилось, что 23% работ содержат ложные утверждения, а критические ошибки в математических доказательствах остаются незамеченными людьми.

Баннер новости 5829

Масштаб кризиса воспроизводимости

В июле 2026 года Hugging Face организовала беспрецедентный хакатон ICML 2026 Open Reproductions. За 19 дней более 1200 участников использовали собственные AI-агенты (Claude Code, Codex, Cursor, OpenResearch's orx) для проверки 2226 статей, принятых на конференцию. Это составило 34% от всех принятых работ (всего 6352 статьи). Итогом стала публикация 6816 логбуков с кодом, артефактами и полными трейсами выполнения агентов.

Проблема усугубляется тем, что количество подаваемых статей растет экспоненциально (в 2026 году подано 23 918 заявок), а количество рецензентов-людей не увеличивается. Как отметил один из рецензентов, он не проверял доказательства в статье, получившей статус Spotlight, из-за нехватки времени. AI-агенты позволили проверить то, что люди физически не успевали.

Ключевые цифры и результаты

Автоматизированный судья на базе модели GLM-5.2 проанализировал 35 908 отдельных утверждений (claims). Результаты показали, что воспроизводимость — это не бинарная величина, а поле конфликта:

Категория результатов Количество статей Доля от проверенных Суть findings
Полная верификация 266 ~12% Все извлеченные утверждения подтверждены независимыми командами.
Частичная верификация 632 ~28% Нет опровергнутых утверждений, но не все claims проверены.
С опровержениями (Falsified) 496 23% Хотя бы одно утверждение ложно. Включая 49 статей с полным провалом.
Противоречивые результаты 242 ~11% Разные команды агентов пришли к противоположным выводам по одним и тем же claims.
Неопределенно / Toy-scale 782 ~35% Недостаточно данных, проприетарные датасеты или симуляции на синтетических данных.

Конкретные фактические ошибки, найденные AI

Самое интересное произошло, когда участники нашли и формально заявили об опровержениях. Hugging Face провела независимую перепроверку этих случаев. Вот три ярких примера:

  • Ошибка в доказательстве (Theorem Break): В статье "Towards Optimal Robustness in Learning-Augmented Paging" утверждалась сложность $H_k + O(1)$. Агенты обнаружили, что аддитивный член растет как $0.38 \ln k$. Ошибка была найдена на шаге 224 в теореме "Attention's forward pass and Frank-Wolfe", где авторы проверяли конечные горизонты, слишком короткие для проявления коллапса токенов. Авторы признали ошибку в тот же день.
  • Несоответствие кода и теории: В работе "Self-Distillation Enables Continual Learning" теория строилась на обратной KL-дивергенции, но код по умолчанию использовал прямую KL-дивергенцию. Это привело к неверным результатам (+4pp), которые не удалось воспроизвести даже с оригинальным кодом.
  • Размытая оценка: В статье "Do Transformers Need Three Projections?" выяснилось, что ~66% оцениваемых позиций меток были заполнены "мусором" (padding), что искусственно завышало метрики.

Почему это важно для индустрии

Этот эксперимент доказал, что AI-агенты могут выполнять роль "второго мнения" в научном рецензировании. Они способны параллельно запускать тысячи экспериментов, находить граничные случаи (edge cases) в доказательствах и выявлять несоответствия между текстом статьи и кодом. Однако 23% статей с ошибками показывают, что текущая система публикации AI-исследований требует обязательного этапа автоматизированной верификации перед принятием в конференцию.

Источник: Hugging Face blog ↗