Робототехника стоит на пороге фундаментального сдвига парадигмы. Долгое время индустрия полагалась на модели, которые учатся описывать мир, а не предсказывать его будущее. Однако появление World Action Models (WAM) — моделей действий в мире, построенных на базе видео-моделирования, а не просто языковых описаний, — меняет правила игры. Это не просто итеративное улучшение, а качественный скачок в способности роботов понимать физику объектов, предвидеть последствия своих действий и адаптироваться к новым условиям без бесконечной дообучки.
В этой статье мы подробно разберем, почему классические Vision-Language-Action (VLA) модели, несмотря на их популярность, достигли предела своих возможностей в задачах манипуляции. Мы рассмотрим архитектуру NVIDIA Cosmos, которая стала фундаментом для нового поколения WAM, и проанализируем практические аспекты развертывания таких систем — от мощных рабочих станций до встраиваемых решений на базе NVIDIA Jetson. Это руководство для инженеров и исследователей, которые хотят понять, как перейти от семантического понимания к физическому предвидению в робототехнике.
01Проблема VLAs: Описание мира против Предсказания динамики
Стандартный подход к созданию политик управления роботами долгое время строился на добавлении модуля действий к предварительно обученным моделям Vision-Language Model (VLM). Результатом становится VLA-модель. Такие системы продемонстрировали впечатляющие результаты в общих задачах манипуляции, позволяя роботам выполнять сложные инструкции, основанные на визуальном контексте. Однако у этого подхода есть критическое ограничение: VLM оптимизированы для описания мира, а не для предсказания того, как он будет эволюционировать.
Представьте себе сценарий, где робот должен взять чашку, наклонить стол, чтобы вылить содержимое, и аккуратно поставить чашку обратно. VLA-модель, обученная на семантических соответствиях, может успешно выполнить задачу, если условия идеально совпадают с обучающей выборкой. Но стоит изменить освещение, форму чашки или положение стола, как модель часто терпит неудачу. Почему? Потому что она не понимает физики процесса. Она не знает, как поведет себя жидкость при наклоне, как изменится центр тяжести или как объект упадет, если его отпустить. Ей не хватает модели динамики мира.
Исследователи, такие как Джим Фэн из NVIDIA, подчеркивают, что будущее за моделями, которые интегрируют понимание динамики. Идея «VLAs мертвы, да здравствуют World Action Models» отражает растущий консенсус в научном сообществе: для надежной робототехники необходимо не просто распознавать объекты, а понимать причинно-следственные связи в физическом пространстве.

02Что такое World Action Models (WAM)?
World Action Models (WAM) преодолевают ограничение VLA, заменяя языковой бэкбон на видео-модель мира. Видео-модель мира — это тип нейронной сети, которая обучается предсказывать будущие кадры видео на основе текущих кадров и заданных действий. Когда эта способность интегрируется в политику управления роботом, получается WAM.
Преимущества такого подхода фундаментальны:
- Обучение на разнообразных данных. В парадигме VLA модель учится сопоставлять инструкции с траекториями, часто требуя почти идентичных демонстраций одной и той же задачи. WAM же учится физике: как объекты двигаются при толчке, захвате или падении. Любые данные взаимодействия становятся обучающим сигналом. Разнообразный набор данных, который был бы бесполезен для VLA, становится ценным ресурсом для WAM, что заметно удешевляет сбор данных.
- Обобщение в открытом мире. Физика более универсальна, чем семантика. То, как объект падает или скользит, не зависит от его названия или цвета. Модель, которая выучила динамику, переносит эти знания на сцены и движения, с которыми она никогда не сталкивалась во время обучения.
- Адаптация к новым роботам. Модель, уже понимающая физическое взаимодействие, требует значительно меньше специфичных для задачи данных для адаптации к новому манипулятору или захвату. Это сокращает время разработки и затраты на калибровку.
Для команд, разрабатывающих политики, это означает практические выгоды: меньше данных для достижения заданной способности, лучшее поведение вне распределения обучения и более короткий путь к новому воплощению робота. Эти свойства являются характеристикой предварительно обученного бэкбона, поэтому они проявляются в каждой политике, дообученной на его основе.

03NVIDIA Cosmos: Фундамент нового поколения
Для реализации потенциала WAM необходим мощный и универсальный фундамент. Здесь на сцену выходит NVIDIA Cosmos — всеобъемлющая мировая модель (omni-model), построенная на архитектуре Mixture-of-Transformers (MoT). Эта архитектура позволяет обрабатывать различные модальности данных, используя оптимальные механизмы генерации для каждой из них.
Мультимодальный вход проходит через авторегрессионный трансформер для рассуждений, производя дискретные токены, такие как текст. Это направляет диффузионный трансформер для непрерывных модальностей, включая изображения, видео, аудио и действия. Текст генерируется путем декодирования следующего токена, а все остальное, включая действия, синтезируется через итеративное удаление шума. Одна модель охватывает эти модальности, сохраняя механизм генерации, наилучшим образом подходящий для каждой.
Масштаб данных, на которых обучалась модель, впечатляет:
- Сотни миллионов изображений;
- Сотни миллионов видео реальной динамики;
- Миллионы образцов действий
Источник: NVIDIA Developer ↗
