Проблема длинных горизонтов в WAM
Модели действий мира (World Action Models, WAM) обещают революцию в управлении роботами, объединяя предсказание визуальной динамики и действий. Однако существующие решения страдают от неэффективности: генерация плотных видеорядов для длинных задач требует огромных вычислительных ресурсов. Попытки упростить задачу, предсказывая только один будущий кадр, игнорируют процесс постепенного приближения к цели, что снижает надежность управления.
Решение: ProWAM и sparse sub-goals
Команда исследователей во главе с Фэем Чжаном представила ProWAM (Progressive World Action Model). Ключевая инновация — совместное предсказание действий и упорядоченной последовательности разреженных визуальных подцелей (sparse visual sub-goals). Вместо генерации всего видео, модель кэширует признаки подцелей за один проход через видео-бэкбон, а политика действий выполняет лишь легковесное «денуазирование» (denoising) при перепланировании. Это позволяет обучать визуальную часть на масштабных видео без действий, разгружая политику управления.
Результаты на симуляциях
ProWAM демонстрирует выдающуюся устойчивость к распределениям (out-of-distribution robustness). Модель установила новые рекорды на ключевых бенчмарках, значительно опередив сильнейшие базовые линии:
| Бенчмарк | Результат ProWAM | Относительный прирост | Примечание |
|---|---|---|---|
| LIBERO-Plus | 85.8% | — | Новый state-of-the-art |
| RoboTwin (randomized) | 75.7% | +35.9% | Превосходство над лучшим бейзлайном |
| RoboCasa365 (Composite-Unseen) | 18.2% | — | 4-е место в общем зачете |
Успех в реальном мире (Zero-shot)
Самое важное подтверждение эффективности — тесты в реальных условиях без дообучения (zero-shot). В новых сценах ProWAM достигла успеха в 70.0% случаев, что на +15.0 процентных пунктов (или +27.3% относительно) лучше предыдущего лидера (55.0%). Это доказывает ценность визуальной дальновидности, привязанной к прогрессу выполнения задачи, для замкнутого цикла управления.
Источник: arXiv cs.AI ↗
