Исследования25 сентября 2026 г., 16:21 МСК🤖 Auto

RECLAIM: AI-агенты провалили воспроизведение 85% ML-статей

Новый бенчмарк RECLAIM показал, что современные AI-агенты способны точно воспроизвести результаты лишь 15% сложных научных статей по машинному обучению.

Баннер новости 8273

Проблема воспроизводимости в эпоху AI

Исследователи из Университета Иллинойса (Mithil Salunkhe, Haochen Ding и др.) представили RECLAIM — первый крупный бенчмарк, оценивающий способность автономных AI-агентов воспроизводить результаты научных статей по машинному обучению. В отличие от существующих тестов, фокусирующихся на коде, RECLAIM проверяет полный цикл: от установки зависимостей и отладки до запуска экспериментов и интерпретации логов.

Бенчмарк базируется на выборке из 100 статей с конференции NeurIPS 2025. Для каждой работы заранее определены целевой результат, критерии успеха и бюджет вычислений (GPU-hours). Это позволяет объективно измерять, насколько близко агент подошел к заявленным в статье метрикам.

Три уровня сложности и провалы агентов

Сложность задачи варьируется в зависимости от того, что авторы статьи опубликовали вместе с текстом. RECLAIM делит задачи на три тира:

  • Run-tier: Доступны код, данные и веса модели. Агенту нужно только запустить эксперимент.
  • Retrain-tier: Код и данные есть, но нет весов. Агент должен обучить модель с нуля.
  • Reimplement-tier: Есть только текст статьи. Агент должен написать код с нуля.

Результаты оказались шокирующими даже для экспертов. Лучшие агенты в каждой категории смогли успешно воспроизвести результаты лишь в малой доле случаев. Оценку проводил отдельный языковая модель, анализирующая логи и выводы, а не отчеты самих агентов.

Уровень сложности (Tier) Что доступно агенту Успешность воспроизведения
Run-tier Код + Данные + Веса 41%
Retrain-tier Код + Данные (без весов) 27%
Reimplement-tier Только текст статьи 15%

Почему агенты терпят неудачу?

Анализ 400 запусков (по 4 агента на каждую из 100 статей) выявил главную причину провалов. В 63 случаях из 100 (63%) агенты писали код метода, не сверяясь ни с одной цифрой из оригинальной статьи. Они генерировали правдоподобный, но неверный код, основываясь на общих знаниях, а не на специфике работы.

Интересно, что неудачные попытки в среднем использовали лишь 29% от выделенного GPU-бюджета. Это означает, что агенты часто «сдавались» или останавливались до завершения вычислений, не исчерпав ресурсы, но и не достигнув цели. Это указывает на проблемы с планированием долгосрочных задач и способностью к самокоррекции в сложных сценариях.

Значение для индустрии

Результаты RECLAIM подчеркивают, что текущие AI-агенты еще не готовы полностью автономно вести научные исследования. Они могут помочь в рутинных задачах (Run-tier), но критически не справляются с интерпретацией научных текстов и написанием кода с нуля (Reimplement-tier). Для доверия к AI-ассистентам в науке необходимо развитие механизмов верификации промежуточных результатов и строгого контроля за соответствием кода исходным данным.

Источник: arXiv cs.AI ↗