Исследования20 июля 2026 г., 09:19 МСК🤖 Auto

ARC-AGI-3: Что реально работает в Coding Agents?

Исследователи разобрали состав успешного агента ARC-AGI-3, выявив, что именно упрощение и верификация дают прирост, а не просто мир-модели.

Баннер новости 3926

Разбор «черного ящика» ARC-AGI-3

Предыдущая версия агента ARC-AGI-3 демонстрировала выдающиеся результаты, но не было ясно, какой именно компонент отвечает за успех: исполняемая модель мира, упрощение данных или точная проверка воспроизведения. Чтобы решить эту проблему атрибуции, команда провела контролируемый эксперимент с четырьмя вложенными агентами на базе Codex.

Экспериментальная архитектура

Исследователи создали четыре итерации агентов, изолируя ключевые механики:

  • Текстовый базовый уровень: Агент без исполняемой модели мира.
  • Гибкая модель мира: Исполняемая модель без проверки воспроизведения.
  • Упрощение: Та же модель с добавленным планированием упрощения (scheduled simplification).
  • Верификация: Фиксированный интерфейс, требующий точного воспроизведения записанных наблюдений.

Ключевые метрики и результаты

Сравнение показало, что наличие «исполняемого мира» само по себе не гарантирует прорыва. Наибольший прирост точности и надежности решений обеспечили именно механизмы упрощения сложных паттернов и строгая верификация через точное воспроизведение состояний.

Компонент агента Исполняемая модель Упрощение Верификация Влияние на результат
Базовый (Text-only) Нет Нет Нет Низкая точность
Гибкая модель Да Нет Нет Умеренный рост
С упрощением Да Да Нет Значительный рост
С верификацией Да Да Да Максимальная надежность

Почему это важно для AI-разработки

Результаты исследования ставят под сомнение слепое внедрение сложных симуляций в LLM-агентов. Оказывается, способность агента «отбрасывать» шум (упрощение) и перепроверять свои шаги (верификация) критичнее, чем просто наличие внутренней модели окружения. Это меняет подход к проектированию систем для сложных логических задач, таких как ARC-AGI.

Источник: arXiv cs.AI ↗