Главная/Блог/Аналитика/Воспроизведение 2200 статей ICML: как…
Аналитика10 мин чтения · 14 августа 2026 г.

Воспроизведение 2200 статей ICML: как AI-агенты меняют науку

Крупнейший в истории эксперимент по воспроизведению научных статей с помощью AI-агентов показал, что каждый третий результат ICML 2026 не выдерживает проверки. Разбираем детали, ошибки и будущее научного рецензирования.

Воспроизведение 2200 статей ICML: как AI-агенты меняют науку

Наука всегда была хрупкой конструкцией, построенной на доверии к данным и методам. Но в эпоху взрывного роста искусственного интеллекта это доверие подвергается беспрецедентному давлению. Конференция ICML 2026 приняла 6 352 статьи — это почти вдвое больше, чем годом ранее. Поток публикаций ускоряется благодаря самим AI-агентам, которые помогают исследователям быстрее проводить эксперименты и писать отчеты. Но кто проверяет тех, кто проверяет? Традиционные механизмы рецензирования, основанные на добровольцах, просто не справляются с объемом. В июле 2026 года Hugging Face запустил беспрецедентный эксперимент: более 1 200 участников использовали собственных AI-кодеров, чтобы воспроизвести результаты 2 226 статей ICML. Это не просто хакатон, это масштабный аудит научной достоверности в реальном времени.

Результаты шокируют. Из проверенных статей 23% содержали хотя бы один опровергнутый claim (утверждение), а в 242 случаях независимые команды приходили к противоположным выводам по одним и тем же экспериментам. Воспроизводимость перестала быть бинарной «да/нет» — она стала полем битвы. В этой статье мы подробно разберем, как проходил этот процесс, какие ошибки были найдены, почему люди все еще незаменимы в научном процессе, и что это значит для будущего машинного обучения.

01Масштаб проблемы: почему старые методы рецензирования сломались

Вопросы о воспроизводимости результатов в AI-исследованиях существуют давно, но масштаб современной волны ИИ усугубил их критически. ICML 2026 получил 23 918 заявок и принял 6 352 статьи. Эта экспоненциальная тенденция частично обусловлена тем, что AI-агенты значительно ускоряют цикл «эксперимент — написание статьи». Однако пропускная способность рецензентов не удвоилась. Большинство рецензентов — это волонтеры, у которых часто нет ни времени, ни глубокой экспертизы, чтобы проверить каждую деталь сложной математической модели или кода.

Вот цитата одного из рецензентов принятой статьи категории Spotlight (выделенной работы), который честно признался:

«Мой низкий балл уверенности обусловлен тем, что я не проверял все доказательства тщательно».

И это при том, что статья получила высокие оценки и была выбрана в Spotlight. Этот пример иллюстрирует системный сбой: когда поток статей превышает возможности человеческого внимания, ошибки проскакивают. Однако та же технология, которая создает этот поток, предлагает и решение. AI-кодеры, такие как Claude Code, Codex, Cursor и Pi, теперь способны прочитать статью, написать код, запустить эксперименты и сообщить о результатах. То, что раньше занимало у рецензента выходные, агент может попытаться сделать за один день, параллельно и тысячи раз.

Цитата рецензента, признавшегося, что он не проверял доказательства тщательно, хотя статья получила высокий балл и статус Spotlight.
Цитата рецензента, признавшегося, что он не проверял доказательства тщательно, хотя статья получила высокий балл и статус Spotlight.

02Как устроен хакатон Open Reproductions

Вместо того чтобы проводить аудит самостоятельно, команда Hugging Face открыла процесс всему сообществу. С 15 июля по 2 августа 2026 года работал ICML 2026 Open Reproductions challenge. Механика была простой, но эффективной:

  1. Выбор статьи. Все 6 341 принятые статьи ICML 2026 были проиндексированы. Из каждой статьи были извлечены основные научные утверждения (claims). Это позволило агентам работать не с 40-страничными PDF-файлами, а с конкретными, проверяемыми целями.
  2. Bring Your Own Agent (BYOA). Участники использовали различные фреймворки: Claude Code, Codex, Cursor, OpenResearch's orx и другие. Был предоставлен унифицированный интерфейс, позволяющий агенту одной командой получить доступ к статье, ее утверждениям и инструкциям.
  3. Воспроизведение и публикация. Каждый запуск создавал Trackio logbook — статическое пространство Hugging Face, содержащее отчет, код, артефакты и (опционально) полный трейс выполнения агента. Сам процесс аудита должен был быть аудируемым.
  4. Автоматическая оценка. Специальный Logbook Judge, работающий на открытой модели GLM-5.2, перечитывал каждый логбук и выносил вердикт по каждому утверждению: verified (подтверждено), falsified (опровергнуто), toy (доказательства на уменьшенном масштабе) или inconclusive (неопределенно). Судья был явно инструктирован не доверять самооценке логбука.

Участники получили по $20 кредитов на вычисления Hugging Face. Всего за время челленджа было запущено 2 962 облачных задания. Там, где полное воспроизведение было невозможно (например, из-за проприетарных датасетов), участники проводили «toy-репродукции» на синтетических данных, имитирующих свойства оригинала.

Схема анатомии процесса воспроизведения: от извлечения claims до запуска агентов и публикации логбуков.
Схема анатомии процесса воспроизведения: от извлечения claims до запуска агентов и публикации логбуков.

03Ключевые цифры и статистика

Этот хакатон, вероятно, стал крупнейшей попыткой воспроизведения научной конференции в истории. Вот основные цифры, которые стоит запомнить:

  • 1 221 участник сообщества присоединились к организации.
  • 6 816 логбуков воспроизведения опубликовано.
  • 2 226 статей было проверено (34% от всей конференции), многие — несколькими независимыми командами.
  • 35 908 утверждений (claims) получили вердикт, все они заморожены в публичном датасете.
  • 2 962 облачных задания HF Jobs были запущены; 274 полных датасетов с трейсами агентов опубликовано на Hugging Face.
Пример логбука воспроизведения с вердиктами и артефактами, опубликованный участником.
Пример логбука воспроизведения с вердиктами и артефактами, опубликованный участником.

04Что мы обнаружили: цифры достоверности

Агрегируя вердикты на уровне утверждений, мы получили следующую картину. Из проверенных статей:

  • 51% (1 103 статьи) имели хотя бы одно утверждение, независимо подтвержденное участниками. Из них 266 статей были воспроизведены полностью (все утверждения подтверждены), а еще 632 — частично, без опровержений. Всего 3 978 индивидуальных утверждений были подтверждены реальными экспериментами.
  • 23% (496 статей) имели хотя бы одно опровергнутое или оспоренное утверждение. Включая 49 статей, где все утверждения были опровергнуты. Но самое интересное: в 242 статьях независимые команды пришли к противоположным вердиктам по одним и тем же утверждениям. Воспроизводимость не бинарна; она антагонистична.
  • Остальные статьи оказались в «серой зоне»: 502 статьи имели только доказательства на уменьшенном масштабе (toy-scale), а 280 статей не позволили установить ничего из-за отсутствия артефактов.

Успешные воспроизведения

Некоторые статьи прошли через этот «горн» безупречно. Например, работа "Flat Minima and Generalization: Insights from Stochastic Convex Optimization" была воспроизведена 20 независимыми командами, 12 из которых подтвердили каждое утверждение. Другая статья, "A Coin Flip for Safety: LLM Judges Fail to Reliably Measure Adversarial Robustness", показала, что 14 из 17 логбуков подтвердили все утверждения. Ирония в том, что статья о ненадежности LLM-судей выдержала проверку со стороны LLM-агентов.

Титульное изображение статьи о воспроизводимости и масштабах проблемы.
Титульное изображение статьи о воспроизводимости и масштабах проблемы.

05Опровержения: когда математика и код врут

35 участников официально заявили, что нашли опровержения. Мы провели адверсариальную перепроверку каждого такого случая: перечитывали статью, логбук, пересчитывали математику и переписывали эксперименты. Вот несколько ярких примеров:

1. Ошибка в доказательствах по paging

Речь идет о той самой статье, рецензент которой признался, что не проверял доказательства. Статья "Towards Optimal Robustness in Learning-Augmented Paging" утверждает, что алгоритм достигает робастности уровня H_k + O(1). Однако логбук одного из участников измерил аддитивный член, растущий как 0.38 ln k, и нашел точный шаг доказательства, который ломается. Наша собственная реимплементация расширила проверку до k = 1,024 и подтвердила рост с сигмой около девяти. Истинная робастность составляет log H_k + Θ(log k), а не константу, как заявлялось.

2. Теорема, падающая после шага 224

В работе "Attention's forward pass and Frank-Wolfe" доказывается, что токены-частицы коллапсируют в начало координат, если оно находится внутри их выпуклой оболочки. Три независимые команды нашли контрпримеры, где нарушения впервые появляются на шагах t = 224, ~3,800 и 6,416. Это объясняет, почему все остальные «подтвердили» утверждение: конечные проверки останавливались слишком рано. Самый чистый контрпример сформулирован в точной рациональной арифметике, поэтому здесь не спрятаться за погрешностями float. Авторы подтвердили ошибку в тот же день и работают над исправлением.

3. Несоответствие теории и кода

В статье "Self-Distillation Enables Continual Learning" центральное уравнение и вся теоретическая секция анализируют обратную дивергенцию Кульбака-Лейблера (reverse KL divergence). Однако в опубликованном коде по умолчанию, который, по словам авторов, дал все результаты статьи, вычисляется прямая дивергенция (forward KL). Логбук, который это обнаружил, также не смог воспроизвести заявленный прирост в +4pp под кодом авторов. Авторы уже загрузили уточненную версию на arXiv.

4. Оценка, разбавленная паддингом

В работе "Do Transformers Need Three Projections?" участник обнаружил, что ~66% оцениваемых позиций меток были токенами EOS (padding), которые обучаются почти к нулевой потере, что искусственно занижает перплексность примерно в три раза. Заявленное в аннотации «3.1% снижение качества при 50% сокращении кэша» на самом деле составляет около 9.4% после коррекции.

🚨
Ложные опровержения. Иногда мы находили flaws в самих попытках воспроизведения. Один логбук заявлял, что метод статьи в 2 раза медленнее базового. Оказалось, это была арифметическая ошибка в воспроизведении: время на траекторию сравнивалось со временем на батч из 50 элементов. При правильной нормализации данные участника подтверждают заявленное авторами ускорение в 8 раз.

06Диалог с авторами: как реагирует наука

Мы начали писать авторам каждой подтвержденной находки с простой формулировкой: «Вот что мы нашли, вот все доказательства, вы согласны или наш анализ ошибочен?». Ранние ответы были очень позитивными. Авторы подтвердили находки по нескольким статьям, два исправления на arXiv уже в процессе. В одном случае автор тихо исправил ошибку в новой версии arXiv за месяц до того, как челлендж ее нашел, что мы считаем независимым сходимостью результатов.

07Роль человека: почему агенты не заменят рецензентов полностью

Самый интересный вопрос, который поднимает этот хакатон: нужна ли людям роль в рецензировании? Мы считаем, что да, по нескольким причинам.

Чистое выполнение агентами имеет пределы

Агенты застревали в локальных циклах, неправильно интерпретировали поведение, зависящее от масштаба (несколько вердиктов «подтверждено» по статье про paging пришли от проверок, остановленных до того, как стал виден рост log-k), и иногда строили целые опровержения на основе ошибки в единицах измерения. Самые надежные результаты челленджа пришли от рабочих процессов, где человек управлял процессом: направлял агента, ставил под сомнение предположения или решал, что premise эксперимента неверна, прежде чем тратить неделю вычислений.

Некоторые оценки необратимо человеческие

Наш победитель с участием человека (human-in-the-loop) — ярчайший пример. Статья утверждала стабильную генерацию изображений при экстремальном квантовании. Числовые метрики говорили «нет коллапса», но вопрос, являются ли изображения пригодными для использования, был перцептивным. Агент создал специализированный UI для рецензирования, а человек лично оценил все 128 пар изображений. Агент затем проверил согласованность аннотаций. Опубликованный трейс агента фиксирует весь обмен, включая вопрос участника: «Я просмотрел пары и положил csv в репо, проверь, пожалуйста».

💡
Совет для исследователей. Роль человека-рецензента трансформируется в управление интеллектом. Как профессор или научный руководитель (PI) создает среду, где аспиранты могут делать хорошую работу, предоставляя вычисления, данные и целевую обратную связь, так и участники челленджа, получившие максимум от агентов, были теми, кто构建了 правильную среду и задавал правильные вопросы, позволяя агентам выполнять рутинную работу.

08Что это значит на практике

Этот эксперимент показывает, что будущее научного рецензирования — это гибридная модель. AI-агенты берут на себя тяжелую работу: парсинг кода, запуск сотен экспериментов, проверку математических выкладок и поиск логических нестыковок. Они могут обработать объем, который физически недоступен человеку. Однако человеческий интеллект остается критически важным для:

  1. Стратегического планирования: Решения о том, какие гипотезы проверять, как интерпретировать аномальные результаты и когда остановить эксперимент.
  2. Перцептивной оценки: Оценки качества генерации, читаемости кода и этической корректности.
  3. Контекстуального анализа: Понимания, почему метод работает в одних условиях и не работает в других, выходя за рамки сухих метрик.

Для исследователей из России и стран СНГ этот опыт особенно актуален. Локальный запуск таких агентов (например, через open-source модели, доступные на Hugging Face, или локальные инференс-серверы) становится все более доступным. Открытые датасеты с трейсами (274 датасета, опубликованных в рамках челленджа) предоставляют уникальную возможность учиться на чужих ошибках и методах. Мы рекомендуем исследователям внедрять практику «агент-рецензента» в свой рабочий процесс: пусть AI проверяет ваш код и математику до того, как это сделает рецензент конференции. Это не только повысит качество ваших публикаций, но и сэкономит время на итерации.

Каждый логбук, вердикт, трейс и артефакт челленджа публичны. Мы считаем это крупнейшим открытым аудитом конференции по машинному обучению на сегодняшний день, и мы надеемся, что этот рекорд будет побит еще быстрее. Следите за будущими событиями по воспроизведению.

Источник: Hugging Face ↗