Исследования21 сентября 2026 г., 10:24 МСК🤖 Auto

VARC: Оптимизация 0.01% параметров решает задачи ARC

Исследователи представили метод Embed-TTT для модели VARC, позволяющий извлекать скрытые правила задач ARC, оптимизируя лишь крошечную часть весов модели.

Баннер новости 7928

Проблема «коротких путей» в ARC

Корпус абстракции и рассуждения (ARC) и его производные (ConceptARC, Mini-ARC) служат золотым стандартом для проверки способности ИИ к обобщению. Однако существующие подходы часто неясно разделяют: модель действительно вывела логическое правило или просто нашла статистическую корреляцию (shortcut)? Авторы работы Adrien Deliège, Claas Beger, Marc Van Droogenbroeck и Melanie Mitchell предлагают решение через архитектуру Vision ARC (VARC).

Метод Embed-TTT: два шага к истине

Ключевое нововведение — протокол обучения на этапе тестирования (Test-Time Training, TTT). В отличие от оригинального VARC, где обучались и бэкбон, и эмбеддинг одновременно, новый метод Embed-TTT разделяет процесс на два этапа:

  • Шаг 1: Дообучается только обучаемый эмбеддинг задачи (Task Embedding), представляющий трансформационное правило.
  • Шаг 2: Эмбеддинг фиксируется, и дообучается основной бэкбон (backbone).

Такая последовательность позволяет изолировать процесс индукции правил от их выполнения.

Результаты: эффективность и интерпретируемость

Метод демонстрирует выдающиеся результаты по соотношению затрат и качества. Оптимизация только эмбеддинга затрагивает менее 0.01% параметров модели, но уже решает нетривиальную долю задач ARC-AGI-1, ConceptARC и Mini-ARC. Полный двухэтапный пайплайн дополнительно повышает точность.

Кроме того, Embed-TTT позволяет проводить линейное зондирование (linear probing) для восстановления известных правил и выявляет семантически значимые связи между задачами. Модель научилась интерполировать правила, но не экстраполировать их за пределы распределения.

Метрика / Аспект Результат / Наблюдение
Доля оптимизируемых параметров < 0.01% (только Task Embedding)
Бенчмарки ARC-AGI-1, ConceptARC, Mini-ARC, два контролируемых датасета
Качество эмбеддинга Лучше выравнивается с underlying rules, улучшает retrieval
Способность к обобщению Интерполяция правил: Да | Экстраполяция: Нет
Интерпретируемость Восстановление геометрической структуры правил, линейное зондирование

Почему это важно

Работа доказывает, что для оценки истинного «понимания» правил ИИ-моделями необходимо разделять этапы индукции и исполнения. Предложенный подход позволяет создавать более строгие бенчмарки, способные отличать модели, работающие по интуиции (на основе распределения), от тех, кто действительно выводит абстрактные законы.

Источник: arXiv cs.AI ↗