Исследования10 сентября 2026 г., 09:17 МСК🤖 Auto

JEPA-модели не умеют выбирать действия: ARC-Bench вскрыл критический баг

Исследование ARC-Bench показало, что замороженные модели мира JEPA структурно некорректно ранжируют действия. Высокая успешность в задачах обусловлена частым перепланированием, а не качеством модели.

Баннер новости 7147

Проблема «тихой» оценки

В основе планирования в latent-пространстве (без обучения с подкреплением) лежит предположение: чем ближе предсказанное будущее состояние к цели, тем лучше действие. Авторы исследования, опубликованного в arXiv (12 августа 2026 года), подвергли это допущение строгой проверке. Они ввели протокол ARC-Bench — тест без утечек данных, который измеряет, действительно ли замороженные веса JEPA-моделей (Joint Embedding Predictive Architecture) позволяют корректно ранжировать кандидаты действий.

Результаты: ранжирование сломано

Аудит официальных чекпоинтов JEPA-WM в задачах навигации и манипуляции выявил структурный дефект. Модель часто выбирает субоптимальные действия как оптимальные. Это не случайная ошибка, а системное искажение метрик.

d>Навигация (PointMaze) d>Манипуляция d>Визуальный бэкбон
Домен Наблюдаемый дефект Масштаб моделей
Частая инверсия рангов: лучший кандидат по латенту — худший по факту ViT-L, ViT-G
Топ-кандидат почти всегда субоптимален V-JEPA 1, V-JEPA 2
Дефект сохраняется при замене DINOv2 на видео-предобученные энкодеры ViT-L, ViT-G

Почему баг оставался незамеченным?

Ключевой вывод работы — замаскированность ошибки частым перепланированием (closed-loop replanning). В реальных сценариях агент часто корректирует траекторию. Исследователи показали, что если снизить частоту перепланирования, успешность (success rate) резко падает. Эпизоды, которые «спасаются» частым обновлением плана, на старте содержат серьезные ошибки ранжирования.

Исключение ложных причин

Авторы исключили тривиальные объяснения провала:

  • Provenance: артефакты сбора данных не влияют на результат.
  • Undertraining: модели достаточно обучены для базовых задач.
  • Controlled backbones: проблема не в архитектуре визуального энкодера (DINOv2 vs V-JEPA).
  • Metric-circularity: исключена цикличность в оценке метрик.

ARC-Bench демонстрирует, что методы, адаптирующие или амортизирующие планирование поверх JEPA, могут переоценивать свои возможности, так как успешность в замкнутом контуре скрывает фундаментальную слабость latent-пространства в ранжировании действий.

Источник: arXiv cs.AI ↗