Проблема воспроизводимости в эпоху AI
Исследователи из Университета Иллинойса (Mithil Salunkhe, Haochen Ding и др.) представили RECLAIM — первый крупный бенчмарк, оценивающий способность автономных AI-агентов воспроизводить результаты научных статей по машинному обучению. В отличие от существующих тестов, фокусирующихся на коде, RECLAIM проверяет полный цикл: от установки зависимостей и отладки до запуска экспериментов и интерпретации логов.
Бенчмарк базируется на выборке из 100 статей с конференции NeurIPS 2025. Для каждой работы заранее определены целевой результат, критерии успеха и бюджет вычислений (GPU-hours). Это позволяет объективно измерять, насколько близко агент подошел к заявленным в статье метрикам.
Три уровня сложности и провалы агентов
Сложность задачи варьируется в зависимости от того, что авторы статьи опубликовали вместе с текстом. RECLAIM делит задачи на три тира:
- Run-tier: Доступны код, данные и веса модели. Агенту нужно только запустить эксперимент.
- Retrain-tier: Код и данные есть, но нет весов. Агент должен обучить модель с нуля.
- Reimplement-tier: Есть только текст статьи. Агент должен написать код с нуля.
Результаты оказались шокирующими даже для экспертов. Лучшие агенты в каждой категории смогли успешно воспроизвести результаты лишь в малой доле случаев. Оценку проводил отдельный языковая модель, анализирующая логи и выводы, а не отчеты самих агентов.
| Уровень сложности (Tier) | Что доступно агенту | Успешность воспроизведения |
|---|---|---|
| Run-tier | Код + Данные + Веса | 41% |
| Retrain-tier | Код + Данные (без весов) | 27% |
| Reimplement-tier | Только текст статьи | 15% |
Почему агенты терпят неудачу?
Анализ 400 запусков (по 4 агента на каждую из 100 статей) выявил главную причину провалов. В 63 случаях из 100 (63%) агенты писали код метода, не сверяясь ни с одной цифрой из оригинальной статьи. Они генерировали правдоподобный, но неверный код, основываясь на общих знаниях, а не на специфике работы.
Интересно, что неудачные попытки в среднем использовали лишь 29% от выделенного GPU-бюджета. Это означает, что агенты часто «сдавались» или останавливались до завершения вычислений, не исчерпав ресурсы, но и не достигнув цели. Это указывает на проблемы с планированием долгосрочных задач и способностью к самокоррекции в сложных сценариях.
Значение для индустрии
Результаты RECLAIM подчеркивают, что текущие AI-агенты еще не готовы полностью автономно вести научные исследования. Они могут помочь в рутинных задачах (Run-tier), но критически не справляются с интерпретацией научных текстов и написанием кода с нуля (Reimplement-tier). Для доверия к AI-ассистентам в науке необходимо развитие механизмов верификации промежуточных результатов и строгого контроля за соответствием кода исходным данным.
Источник: arXiv cs.AI ↗
