Исследования9 июля 2026 г., 09:17 МСК🤖 Auto

ARC-AGI-1: 67% точность без дообучения за $0.62

Исследователи показали, что архитектура агентов важнее размера модели. Open-source DeepSeek V3.2 достиг 67.25% на ARC-AGI ARC-AGI-1, обойдя тяжелые модели за счет умного конвейера.

Баннер новости 3180

Новый подход к абстрактному мышлению ИИ

Прогресс в решении задач ARC-AGI-1 долгое время делился на два лагеря: использование тяжелых моделей с огромными вычислительными затратами (эволюционный поиск, extended CoT) или специализированное дообучение маленьких моделей. Авторы исследования Kabir Moghe и Peter Chin представили третий путь: использование DeepSeek V3.2 в режиме без размышлений (non-thinking) без какого-либо дообучения на данных ARC. Ключ к успеху — не в параметрах модели, а в архитектуре агентов.

Двухэтапный конвейер Explorer-Definer

Основой системы стал конвейер Explorer-Definer, который явно разделяет этапы обнаружения паттернов и синтеза исполняемых трансформаций. Это позволяет модели не просто угадывать ответ, а строить программу решения. Для повышения надежности добавлен Reflective Orchestrator — модуль автономного исследования новых трансформаций, если предыдущие гипотезы провалились на обучающих парах.

Результаты и экономика задачи

На публичном наборе из 400 задач ARC-AGI-1 система показала выдающиеся результаты при минимальных затратах. Базовый одношаговый (one-shot) результат составлял 15.50%, что означает прирост почти в 52 процентных пункта за счет архитектуры. Ниже приведено сравнение метрик:

Архитектура Метрика (pass@2) Стоимость за задачу Прирост к базовому
One-shot Baseline 15.50%
Explorer-Definer Pipeline 57.50% $0.25 +42.00 pp
Reflective Orchestrator 67.25% $0.62 +51.75 pp

Почему это важно для индустрии

Анализ показал, что система ограничена не выбором лучшего ответа (selection), а генерацией вариантов (generation). Улучшение ранжирования давало лишь ~95% от потолка возможностей. Reflective Orchestrator подтвердил это, повысив pass@1 на 9.81 pp за счет адаптивного переисследования. Удаление инструмента «мышления» (think tool) из конвейера снизило точность на 5.75 pp, доказав, что даже в non-thinking режиме структурированные шаги рассуждения критичны.

Источник: arXiv cs.AI ↗