От семантики к физике: почему VLA уходят в прошлое
Ключевая проблема современной робототехники — обобщение за пределы обучающих демонстраций. Традиционные модели Vision-Language-Action (VLA) строятся на базе VLM, которые учатся описывать мир, но не предсказывают, как он эволюционирует. Они не знают, что произойдет с чашкой при захвате или как сложится полотенце. NVIDIA предлагает заменить языковой бэкбон на видео-модель мира (World Model), создав World Action Model (WAM). Это дает политике физический prior: она понимает динамику объектов, а не только их семантику.
Архитектура и данные NVIDIA Cosmos 3
Фундаментом для WAM стала открытая модель NVIDIA Cosmos 3, построенная на архитектуре Mixture-of-Transformers (MoT). Она объединяет авторегрессионный трансформер для дискретных токенов (текст) и диффузионный трансформер для непрерывных модальностей (видео, аудио, действия). Модель обучена на огромном наборе данных, содержащем:
- ~767 млн изображений;
- 348 млн видео реальной динамики;
- 8 млн сэмплов действий (манипуляция, вождение, движение камеры).
Сравнение подходов: VLA против WAM
WAM-подход обеспечивает лучшие результаты при адаптации к новым роботам и средам благодаря пониманию законов физики. Ниже приведено сравнение ключевых характеристик:
| Характеристика | VLA (Vision-Language-Action) | WAM (World Action Model) |
|---|---|---|
| Основа бэкбона | VLM (описание сцены) | Video World Model (предсказание динамики) |
| Обобщение | Семантическое (похожие сцены) | Физическое (zero-shot transfer) |
| Требования к данным | Требует идентичных демонстраций | Любое взаимодействие учит движению объектов |
| Адаптация к новому роботу | Требует много данных | Минимум данных благодаря физическому prior |
Практическая реализация: DROID и Jetson
Для демонстрации эффективности NVIDIA представила политики Cosmos3-Nano-Policy-DROID (16B параметров) и Cosmos3-Edge-Policy-DROID (4B параметров), обученные на базе робота DROID (Franka Panda + Robotiq). Ключевое преимущество — модель «воображает» результат действия одновременно с его генерацией, выводя предсказанное видео с камер робота.
Результаты тестов на RoboLab показали рост успешности выполнения задач с 28.1% до 36.8% при использовании омни-чекпоинта по сравнению с базовым, что доказывает влияние архитектуры, а не только масштаба. Развертывание поддерживается на разных уровнях:
- Workstation (Nano, 16B): Запуск на NVIDIA RTX PRO 6000, стриминг наблюдений по сети.
- On-device (Edge, 4B): Инференс на NVIDIA Jetson Thor с разрешением 640×360 и генерацией 32 действий за инференс в реальном времени.
Бенчмарки
| Бенчмарк | Cosmos 3 (base checkpoint) | Cosmos 3 (omni checkpoint) |
|---|---|---|
| RoboLab | 28.1% | 36.8% |
Жирным — лучший результат в строке. Источник цифр — официальная публикация.
Источник: NVIDIA dev blog ↗
