Проблема «коротких путей» в ARC
Корпус абстракции и рассуждения (ARC) и его производные (ConceptARC, Mini-ARC) служат золотым стандартом для проверки способности ИИ к обобщению. Однако существующие подходы часто неясно разделяют: модель действительно вывела логическое правило или просто нашла статистическую корреляцию (shortcut)? Авторы работы Adrien Deliège, Claas Beger, Marc Van Droogenbroeck и Melanie Mitchell предлагают решение через архитектуру Vision ARC (VARC).
Метод Embed-TTT: два шага к истине
Ключевое нововведение — протокол обучения на этапе тестирования (Test-Time Training, TTT). В отличие от оригинального VARC, где обучались и бэкбон, и эмбеддинг одновременно, новый метод Embed-TTT разделяет процесс на два этапа:
- Шаг 1: Дообучается только обучаемый эмбеддинг задачи (Task Embedding), представляющий трансформационное правило.
- Шаг 2: Эмбеддинг фиксируется, и дообучается основной бэкбон (backbone).
Такая последовательность позволяет изолировать процесс индукции правил от их выполнения.
Результаты: эффективность и интерпретируемость
Метод демонстрирует выдающиеся результаты по соотношению затрат и качества. Оптимизация только эмбеддинга затрагивает менее 0.01% параметров модели, но уже решает нетривиальную долю задач ARC-AGI-1, ConceptARC и Mini-ARC. Полный двухэтапный пайплайн дополнительно повышает точность.
Кроме того, Embed-TTT позволяет проводить линейное зондирование (linear probing) для восстановления известных правил и выявляет семантически значимые связи между задачами. Модель научилась интерполировать правила, но не экстраполировать их за пределы распределения.
| Метрика / Аспект | Результат / Наблюдение |
|---|---|
| Доля оптимизируемых параметров | < 0.01% (только Task Embedding) |
| Бенчмарки | ARC-AGI-1, ConceptARC, Mini-ARC, два контролируемых датасета |
| Качество эмбеддинга | Лучше выравнивается с underlying rules, улучшает retrieval |
| Способность к обобщению | Интерполяция правил: Да | Экстраполяция: Нет |
| Интерпретируемость | Восстановление геометрической структуры правил, линейное зондирование |
Почему это важно
Работа доказывает, что для оценки истинного «понимания» правил ИИ-моделями необходимо разделять этапы индукции и исполнения. Предложенный подход позволяет создавать более строгие бенчмарки, способные отличать модели, работающие по интуиции (на основе распределения), от тех, кто действительно выводит абстрактные законы.
Источник: arXiv cs.AI ↗
