Новый подход к абстрактному мышлению ИИ
Прогресс в решении задач ARC-AGI-1 долгое время делился на два лагеря: использование тяжелых моделей с огромными вычислительными затратами (эволюционный поиск, extended CoT) или специализированное дообучение маленьких моделей. Авторы исследования Kabir Moghe и Peter Chin представили третий путь: использование DeepSeek V3.2 в режиме без размышлений (non-thinking) без какого-либо дообучения на данных ARC. Ключ к успеху — не в параметрах модели, а в архитектуре агентов.
Двухэтапный конвейер Explorer-Definer
Основой системы стал конвейер Explorer-Definer, который явно разделяет этапы обнаружения паттернов и синтеза исполняемых трансформаций. Это позволяет модели не просто угадывать ответ, а строить программу решения. Для повышения надежности добавлен Reflective Orchestrator — модуль автономного исследования новых трансформаций, если предыдущие гипотезы провалились на обучающих парах.
Результаты и экономика задачи
На публичном наборе из 400 задач ARC-AGI-1 система показала выдающиеся результаты при минимальных затратах. Базовый одношаговый (one-shot) результат составлял 15.50%, что означает прирост почти в 52 процентных пункта за счет архитектуры. Ниже приведено сравнение метрик:
| Архитектура | Метрика (pass@2) | Стоимость за задачу | Прирост к базовому |
|---|---|---|---|
| One-shot Baseline | 15.50% | — | — |
| Explorer-Definer Pipeline | 57.50% | $0.25 | +42.00 pp |
| Reflective Orchestrator | 67.25% | $0.62 | +51.75 pp |
Почему это важно для индустрии
Анализ показал, что система ограничена не выбором лучшего ответа (selection), а генерацией вариантов (generation). Улучшение ранжирования давало лишь ~95% от потолка возможностей. Reflective Orchestrator подтвердил это, повысив pass@1 на 9.81 pp за счет адаптивного переисследования. Удаление инструмента «мышления» (think tool) из конвейера снизило точность на 5.75 pp, доказав, что даже в non-thinking режиме структурированные шаги рассуждения критичны.
Источник: arXiv cs.AI ↗
