Релиз модели4 августа 2026 г., 19:17 МСК🤖 Auto

NVIDIA Cosmos 3: WAM-модели заменяют VLA в робототехнике

NVIDIA представила архитектуру World Action Models (WAM) на базе Cosmos 3, обеспечивающую zero-shot перенос навыков и предсказание динамики, в отличие от традиционных VLA-моделей.

Баннер новости 5056

От семантики к физике: почему VLA уходят в прошлое

Ключевая проблема современной робототехники — обобщение за пределы обучающих демонстраций. Традиционные модели Vision-Language-Action (VLA) строятся на базе VLM, которые учатся описывать мир, но не предсказывают, как он эволюционирует. Они не знают, что произойдет с чашкой при захвате или как сложится полотенце. NVIDIA предлагает заменить языковой бэкбон на видео-модель мира (World Model), создав World Action Model (WAM). Это дает политике физический prior: она понимает динамику объектов, а не только их семантику.

Архитектура и данные NVIDIA Cosmos 3

Фундаментом для WAM стала открытая модель NVIDIA Cosmos 3, построенная на архитектуре Mixture-of-Transformers (MoT). Она объединяет авторегрессионный трансформер для дискретных токенов (текст) и диффузионный трансформер для непрерывных модальностей (видео, аудио, действия). Модель обучена на огромном наборе данных, содержащем:

  • ~767 млн изображений;
  • 348 млн видео реальной динамики;
  • 8 млн сэмплов действий (манипуляция, вождение, движение камеры).

Сравнение подходов: VLA против WAM

WAM-подход обеспечивает лучшие результаты при адаптации к новым роботам и средам благодаря пониманию законов физики. Ниже приведено сравнение ключевых характеристик:

Характеристика VLA (Vision-Language-Action) WAM (World Action Model)
Основа бэкбона VLM (описание сцены) Video World Model (предсказание динамики)
Обобщение Семантическое (похожие сцены) Физическое (zero-shot transfer)
Требования к данным Требует идентичных демонстраций Любое взаимодействие учит движению объектов
Адаптация к новому роботу Требует много данных Минимум данных благодаря физическому prior

Практическая реализация: DROID и Jetson

Для демонстрации эффективности NVIDIA представила политики Cosmos3-Nano-Policy-DROID (16B параметров) и Cosmos3-Edge-Policy-DROID (4B параметров), обученные на базе робота DROID (Franka Panda + Robotiq). Ключевое преимущество — модель «воображает» результат действия одновременно с его генерацией, выводя предсказанное видео с камер робота.

Результаты тестов на RoboLab показали рост успешности выполнения задач с 28.1% до 36.8% при использовании омни-чекпоинта по сравнению с базовым, что доказывает влияние архитектуры, а не только масштаба. Развертывание поддерживается на разных уровнях:

  • Workstation (Nano, 16B): Запуск на NVIDIA RTX PRO 6000, стриминг наблюдений по сети.
  • On-device (Edge, 4B): Инференс на NVIDIA Jetson Thor с разрешением 640×360 и генерацией 32 действий за инференс в реальном времени.

Бенчмарки

БенчмаркCosmos 3 (base checkpoint)Cosmos 3 (omni checkpoint)
RoboLab28.1%36.8%

Жирным — лучший результат в строке. Источник цифр — официальная публикация.

Источник: NVIDIA dev blog ↗