Исследования6 октября 2026 г., 02:17 МСК🤖 Auto

ProWAM: Прогрессивное планирование для роботов с точностью 85.8%

Новая модель ProWAM решает проблему длинных горизонтов в робототехнике, предсказывая не видео, а ключевые визуальные подцели, что дало прирост до +35.9% на симуляциях.

Баннер новости 8992

Проблема длинных горизонтов в WAM

Модели действий мира (World Action Models, WAM) обещают революцию в управлении роботами, объединяя предсказание визуальной динамики и действий. Однако существующие решения страдают от неэффективности: генерация плотных видеорядов для длинных задач требует огромных вычислительных ресурсов. Попытки упростить задачу, предсказывая только один будущий кадр, игнорируют процесс постепенного приближения к цели, что снижает надежность управления.

Решение: ProWAM и sparse sub-goals

Команда исследователей во главе с Фэем Чжаном представила ProWAM (Progressive World Action Model). Ключевая инновация — совместное предсказание действий и упорядоченной последовательности разреженных визуальных подцелей (sparse visual sub-goals). Вместо генерации всего видео, модель кэширует признаки подцелей за один проход через видео-бэкбон, а политика действий выполняет лишь легковесное «денуазирование» (denoising) при перепланировании. Это позволяет обучать визуальную часть на масштабных видео без действий, разгружая политику управления.

Результаты на симуляциях

ProWAM демонстрирует выдающуюся устойчивость к распределениям (out-of-distribution robustness). Модель установила новые рекорды на ключевых бенчмарках, значительно опередив сильнейшие базовые линии:

Бенчмарк Результат ProWAM Относительный прирост Примечание
LIBERO-Plus 85.8% — Новый state-of-the-art
RoboTwin (randomized) 75.7% +35.9% Превосходство над лучшим бейзлайном
RoboCasa365 (Composite-Unseen) 18.2% — 4-е место в общем зачете

Успех в реальном мире (Zero-shot)

Самое важное подтверждение эффективности — тесты в реальных условиях без дообучения (zero-shot). В новых сценах ProWAM достигла успеха в 70.0% случаев, что на +15.0 процентных пунктов (или +27.3% относительно) лучше предыдущего лидера (55.0%). Это доказывает ценность визуальной дальновидности, привязанной к прогрессу выполнения задачи, для замкнутого цикла управления.

Источник: arXiv cs.AI ↗