Суть эксперимента: воспроизведение AI Safety via Debate
Автор исследования Герард Боко (Gerard Boxo) поставил перед 12 моделями от GPT-3 до GPT-5.6 задачу: реализовать эксперимент из знаковой работы 2018 года "AI Safety via Debate" (Irving, Christiano & Amodei). Задача требовала написания кода на Python, включающего два ключевых компонента:
- Обучение CNN-судьи, классифицирующего цифры MNIST по 6 пикселям.
- Игровой процесс дебатов с использованием Monte Carlo Tree Search (MCTS), где один агент аргументирует истину, а другой — ложь.
Для оценки качества автор составил чек-лист из 14 конкретных технических требований. Это позволило измерить прогресс не бинарно ("сработало/не сработало"), а количественно.
Хронология эволюции способностей
Результаты демонстрируют, что так называемая "эмерджентная способность" к сложному кодингу на самом деле является предсказуемым трендом. Вот как менялись результаты по поколениям моделей:
| Модель | Статус реализации | Ключевые проблемы |
|---|---|---|
| GPT-3 (davinci-002) | Неудачно | Пытался реализовать классификатор, но код был хаотичным и не работал. |
| GPT-3.5 | Частично | Правильно определил классификатор, но провалил обучение на разреженных пикселях или использовал случайные ходы. |
| GPT-4 | Неудачно | Не реализовал ни судью, ни игровой процесс дебатов корректно. |
| GPT-4 Turbo | Заглушки | Начал активно использовать placeholder-функции, избегая сложной логики. |
| GPT-4o | Частично | Использовал заглушки или ошибался в логике MCTS. |
| o1 | Прорыв | В третьей попытке впервые построил корректное дерево PUCT и протокол дебатов (первые две попытки имели flaws). |
| GPT-4.1, o3 | Почти верно | Реализация выглядела рабочей, но оставались тонкие ошибки (например, пропущенный знак минуса, превращавший игру в кооперативную). |
| GPT-5 — GPT-5.6 | Успешно | К GPT-5.6 все три попытки полностью воспроизвели эксперимент без ошибок. |
Почему это важно для индустрии
Главный вывод автора заключается в том, что оценка прогресса через бинарные метрики ("полезно/бесполезно") скрывает реальную динамику. В 2023 году попытки моделей были настолько далеки от истины, что система верификации (RLVR) не могла бы отделить хороший ответ от плохого — объекту просто не за что было зацепиться.
Прогресс был измеримым задолго до того, как модели начали выдавать готовый результат. Это критически важно для прогнозирования появления "AI-ассистентов" для научных исследований: даже если текущие модели кажутся неспособными к самостоятельной науке, их базовые способности к верифицируемому кодингу растут линейно, и порог полезности будет преодолен не внезапно, а как следствие накопленных улучшений.
Источник: LessWrong ↗
