Разбор «черного ящика» ARC-AGI-3
Предыдущая версия агента ARC-AGI-3 демонстрировала выдающиеся результаты, но не было ясно, какой именно компонент отвечает за успех: исполняемая модель мира, упрощение данных или точная проверка воспроизведения. Чтобы решить эту проблему атрибуции, команда провела контролируемый эксперимент с четырьмя вложенными агентами на базе Codex.
Экспериментальная архитектура
Исследователи создали четыре итерации агентов, изолируя ключевые механики:
- Текстовый базовый уровень: Агент без исполняемой модели мира.
- Гибкая модель мира: Исполняемая модель без проверки воспроизведения.
- Упрощение: Та же модель с добавленным планированием упрощения (scheduled simplification).
- Верификация: Фиксированный интерфейс, требующий точного воспроизведения записанных наблюдений.
Ключевые метрики и результаты
Сравнение показало, что наличие «исполняемого мира» само по себе не гарантирует прорыва. Наибольший прирост точности и надежности решений обеспечили именно механизмы упрощения сложных паттернов и строгая верификация через точное воспроизведение состояний.
| Компонент агента | Исполняемая модель | Упрощение | Верификация | Влияние на результат |
|---|---|---|---|---|
| Базовый (Text-only) | Нет | Нет | Нет | Низкая точность |
| Гибкая модель | Да | Нет | Нет | Умеренный рост |
| С упрощением | Да | Да | Нет | Значительный рост |
| С верификацией | Да | Да | Да | Максимальная надежность |
Почему это важно для AI-разработки
Результаты исследования ставят под сомнение слепое внедрение сложных симуляций в LLM-агентов. Оказывается, способность агента «отбрасывать» шум (упрощение) и перепроверять свои шаги (верификация) критичнее, чем просто наличие внутренней модели окружения. Это меняет подход к проектированию систем для сложных логических задач, таких как ARC-AGI.
Источник: arXiv cs.AI ↗
