Новый подход к планированию действий
Команда исследователей во главе с Хаотианом Лянгом представила Hy-Embodied-RxBrain (RxBrain) — модель, решающую ключевую проблему робототехники и ИИ: разрыв между абстрактным пониманием задачи и физическим выполнением. В отличие от стандартных VLM (Vision-Language Models), которые лишь описывают сцену, или генеративных моделей мира, предсказывающих будущие кадры, RxBrain создает единый последовательный план, где язык и визуальное воображение дополняют друг друга.
Текст задает абстрактную структуру: декомпозицию задачи, ограничения и логику решений. Визуальная часть «заземляет» этот план, предсказывая промежуточные физические состояния мира. Это позволяет модели не просто «думать», но и «видеть» результат своих действий до их совершения.
Архитектура и обучение
RxBrain использует унифицированную архитектуру Mixture-of-Transformers, способную одновременно понимать и генерировать текст, изображения и видео. Для обучения модели авторы разработали автоматический пайплайн, который:
- Разлагает видео с действиями на шаги планирования;
- Сопоставляет эти шаги с переходами визуальных состояний;
- Создает совместный текстово-визуальный надзор (supervision) для обучения.
Результаты и бенчмарк
Для оценки способности моделей к совместному планированию создана метрика RxBrain-Bench. Эксперименты показали, что RxBrain сохраняет навыки понимания и генерации, производя планы с связанной текстовой рассудительностью и предсказанием состояний. Особый интерес представляет применение модели для непрерывной генерации действий робота: RxBrain демонстрирует перспективные результаты на реальном оборудовании без предварительного обучения на масштабных наборах данных с действиями (action-data pretraining).
Значение для отрасли
Работа RxBrain является первым шагом к созданию фундаментальных моделей для воплощенного познания (embodied cognition). Способность ИИ совмещать абстрактное логическое мышление с визуальным моделированием последствий открывает путь к более автономным и надежным роботизированным системам, способным действовать в сложных физических средах.
Источник: arXiv cs.AI ↗
