Проблема абстрактного вывода
Задачи ARC-AGI-2 требуют от моделей не просто распознавания паттернов, а глубокого понимания абстрактных правил трансформации. Традиционные подходы часто застревают на этапе генерации гипотез или не могут эффективно верифицировать их в условиях жестких ограничений по времени и вычислительным ресурсам. Авторы работы из группы Kunbo Zhang предлагают решение, объединяющее символический поиск и машинное обучение.
Архитектура ARCANA
Система ARCANA (Reflective Multi-Agent Program Synthesis Framework) построена на взаимодействии четырех специализированных агентов, которые общаются через общий дифференцируемый «черный ящик» (blackboard). Процесс разбит на итеративные циклы:
- Perceptual Grounding Agent: Анализирует сырые сетки (grids) и строит объектно-ориентированные графы сцен, выделяя ключевые элементы.
- Latent Program Policy: Предлагает разнообразные программы на доменно-специфичном языке (DSL), основываясь на текущем состоянии задачи.
- Symbolic Executor: Выполняет предложенные программы на демонстрационных данных для проверки их корректности.
- Reflective Agent: Анализирует ошибки и формирует обратную связь для корректировки стратегии на следующем шаге.
Роль мета-контроллера
Ключевым элементом координации выступает обученный мета-контроллер (meta controller). Он динамически планирует работу агентов, определяя, когда нужно сгенерировать новую гипотезу, а когда — провести рефлексию. Такой подход позволяет комбинировать преимущества структурированного поиска программ с адаптивной многошаговой коррекцией, что критически важно для сложных задач, где правило неочевидно.
Результаты и значимость
ARCANA демонстрирует улучшение как эффективности рассуждений, так и качества решений по сравнению с базовыми методами. Система успешно справляется с задачами, требующими многошагового логического вывода, и делает это в рамках строгих тестовых ограничений. Это шаг к созданию более автономных AI-систем, способных к самокоррекции и планированию действий в неопределенной среде.
Источник: arXiv cs.AI ↗
