Проблема: статика подавляет динамику
Мировые модели (World Models) для робототехники и embodied-агентов часто страдают от того, что не могут достоверно моделировать физические взаимодействия. Существующие подходы пытаются исправить это, используя внешние представления (геометрию, семантику), что требует сложных вспомогательных оценщиков или ручной разметки данных, ограничивая масштабируемость.
Авторы статьи (Rongze Tang, Jianjie Fang и соавторы) выявили корневую причину: при использовании глобально усредненной функции потерь MSE (Mean Squared Error) сигнал оптимизации доминируется статичным контентом фона. В результате редкие, но критически важные регионы с движущимися объектами получают недостаточный надзор (under-supervised), что приводит к физически неправдоподобным результатам.
Решение: Attention как карта взаимодействия
Предложенный фреймворк IMPACT (Interaction-aware Model training framework with Prior-guided Attention Calibration and Targeting) решает проблему без внешних данных. Метод использует кросс-внимание (cross-attention), связанное с токенами манипулируемых объектов, как внутренний пространственно-временной приор.
Алгоритм работает в три шага:
- Сэмплирование: выделение кандидатных регионов из карты внимания.
- Калибровка: коррекция этих регионов с помощью локальных ошибок предсказания (detached local prediction errors).
- Перевзвешивание: создание «карты взаимодействия» (interaction map), которая перебалансирует сигнал обучения, заставляя модель уделять больше внимания зонам контакта и движения.
Результаты и бенчмарки
Эксперименты проводились на задачах манипуляции роботизированной рукой и человеческой кистью, используя различные модальности управления и бэкбон DiT (Diffusion Transformer). IMPACT стабильно превосходит базовые модели, обученные только на MSE, улучшая три ключевые метрики:
| Метрика / Аспект | Результат IMPACT vs Baseline (MSE) |
|---|---|
| Точность взаимодействия (Interaction Fidelity) | Значительное улучшение достоверности контакта объектов |
| Физическая правдоподобность | Снижение артефактов и «проваливания» объектов |
| Визуальное качество | Повышение четкости динамических элементов |
| Масштабируемость | Не требует внешних представлений или модификаций на этапе инференса |
Почему это важно
IMPACT демонстрирует, что внутренние механизмы внимания трансформеров могут служить мощным индикатором значимости для обучения, если правильно настроить функцию потерь. Это устраняет узкое горлышко в сборе данных для симуляций и реального мира, позволяя обучать более надежных роботов-манипуляторов без дорогостоящей разметки глубины или семантики.
Источник: arXiv cs.AI ↗
