Исследования6 августа 2026 г., 22:17 МСК🤖 Auto

3 года прогресса в 500 строках: как LLM учились воспроизводить научные эксперименты

Исследование показывает, что способность моделей к сложному кодингу развивалась плавно, но незаметно. Только к GPT-5.6 модели смогли корректно реализовать сложный алгоритм дебатов, хотя первые шаги были видны еще в 2023 году.

Баннер новости 5244

Суть эксперимента: воспроизведение AI Safety via Debate

Автор исследования Герард Боко (Gerard Boxo) поставил перед 12 моделями от GPT-3 до GPT-5.6 задачу: реализовать эксперимент из знаковой работы 2018 года "AI Safety via Debate" (Irving, Christiano & Amodei). Задача требовала написания кода на Python, включающего два ключевых компонента:

  • Обучение CNN-судьи, классифицирующего цифры MNIST по 6 пикселям.
  • Игровой процесс дебатов с использованием Monte Carlo Tree Search (MCTS), где один агент аргументирует истину, а другой — ложь.

Для оценки качества автор составил чек-лист из 14 конкретных технических требований. Это позволило измерить прогресс не бинарно ("сработало/не сработало"), а количественно.

Хронология эволюции способностей

Результаты демонстрируют, что так называемая "эмерджентная способность" к сложному кодингу на самом деле является предсказуемым трендом. Вот как менялись результаты по поколениям моделей:

Модель Статус реализации Ключевые проблемы
GPT-3 (davinci-002) Неудачно Пытался реализовать классификатор, но код был хаотичным и не работал.
GPT-3.5 Частично Правильно определил классификатор, но провалил обучение на разреженных пикселях или использовал случайные ходы.
GPT-4 Неудачно Не реализовал ни судью, ни игровой процесс дебатов корректно.
GPT-4 Turbo Заглушки Начал активно использовать placeholder-функции, избегая сложной логики.
GPT-4o Частично Использовал заглушки или ошибался в логике MCTS.
o1 Прорыв В третьей попытке впервые построил корректное дерево PUCT и протокол дебатов (первые две попытки имели flaws).
GPT-4.1, o3 Почти верно Реализация выглядела рабочей, но оставались тонкие ошибки (например, пропущенный знак минуса, превращавший игру в кооперативную).
GPT-5 — GPT-5.6 Успешно К GPT-5.6 все три попытки полностью воспроизвели эксперимент без ошибок.

Почему это важно для индустрии

Главный вывод автора заключается в том, что оценка прогресса через бинарные метрики ("полезно/бесполезно") скрывает реальную динамику. В 2023 году попытки моделей были настолько далеки от истины, что система верификации (RLVR) не могла бы отделить хороший ответ от плохого — объекту просто не за что было зацепиться.

Прогресс был измеримым задолго до того, как модели начали выдавать готовый результат. Это критически важно для прогнозирования появления "AI-ассистентов" для научных исследований: даже если текущие модели кажутся неспособными к самостоятельной науке, их базовые способности к верифицируемому кодингу растут линейно, и порог полезности будет преодолен не внезапно, а как следствие накопленных улучшений.

Источник: LessWrong ↗