Масштаб кризиса воспроизводимости
В июле 2026 года Hugging Face организовала беспрецедентный хакатон ICML 2026 Open Reproductions. За 19 дней более 1200 участников использовали собственные AI-агенты (Claude Code, Codex, Cursor, OpenResearch's orx) для проверки 2226 статей, принятых на конференцию. Это составило 34% от всех принятых работ (всего 6352 статьи). Итогом стала публикация 6816 логбуков с кодом, артефактами и полными трейсами выполнения агентов.
Проблема усугубляется тем, что количество подаваемых статей растет экспоненциально (в 2026 году подано 23 918 заявок), а количество рецензентов-людей не увеличивается. Как отметил один из рецензентов, он не проверял доказательства в статье, получившей статус Spotlight, из-за нехватки времени. AI-агенты позволили проверить то, что люди физически не успевали.
Ключевые цифры и результаты
Автоматизированный судья на базе модели GLM-5.2 проанализировал 35 908 отдельных утверждений (claims). Результаты показали, что воспроизводимость — это не бинарная величина, а поле конфликта:
| Категория результатов | Количество статей | Доля от проверенных | Суть findings |
|---|---|---|---|
| Полная верификация | 266 | ~12% | Все извлеченные утверждения подтверждены независимыми командами. |
| Частичная верификация | 632 | ~28% | Нет опровергнутых утверждений, но не все claims проверены. |
| С опровержениями (Falsified) | 496 | 23% | Хотя бы одно утверждение ложно. Включая 49 статей с полным провалом. |
| Противоречивые результаты | 242 | ~11% | Разные команды агентов пришли к противоположным выводам по одним и тем же claims. |
| Неопределенно / Toy-scale | 782 | ~35% | Недостаточно данных, проприетарные датасеты или симуляции на синтетических данных. |
Конкретные фактические ошибки, найденные AI
Самое интересное произошло, когда участники нашли и формально заявили об опровержениях. Hugging Face провела независимую перепроверку этих случаев. Вот три ярких примера:
- Ошибка в доказательстве (Theorem Break): В статье "Towards Optimal Robustness in Learning-Augmented Paging" утверждалась сложность $H_k + O(1)$. Агенты обнаружили, что аддитивный член растет как $0.38 \ln k$. Ошибка была найдена на шаге 224 в теореме "Attention's forward pass and Frank-Wolfe", где авторы проверяли конечные горизонты, слишком короткие для проявления коллапса токенов. Авторы признали ошибку в тот же день.
- Несоответствие кода и теории: В работе "Self-Distillation Enables Continual Learning" теория строилась на обратной KL-дивергенции, но код по умолчанию использовал прямую KL-дивергенцию. Это привело к неверным результатам (+4pp), которые не удалось воспроизвести даже с оригинальным кодом.
- Размытая оценка: В статье "Do Transformers Need Three Projections?" выяснилось, что ~66% оцениваемых позиций меток были заполнены "мусором" (padding), что искусственно завышало метрики.
Почему это важно для индустрии
Этот эксперимент доказал, что AI-агенты могут выполнять роль "второго мнения" в научном рецензировании. Они способны параллельно запускать тысячи экспериментов, находить граничные случаи (edge cases) в доказательствах и выявлять несоответствия между текстом статьи и кодом. Однако 23% статей с ошибками показывают, что текущая система публикации AI-исследований требует обязательного этапа автоматизированной верификации перед принятием в конференцию.
Источник: Hugging Face blog ↗
