Революция на краю сети: Cosmos 3 Edge
NVIDIA анонсировала Cosmos 3 Edge — новую версию своей всеобъемлющей модели (omni-model) объемом 4 миллиарда параметров, включающую 2-миллиардный.reasoner на базе Nemotron. В отличие от более крупных версий семейства Cosmos 3, эта модель специально разработана для работы on-device (на самом устройстве). Она способна функционировать на борту роботов с вычислительным модулем NVIDIA Jetson AGX Thor, устраняя необходимость в отправке данных в облако для принятия решений.
Производительность и задержки
Ключевая проблема внедрения больших моделей в робототехнику — задержка (latency) и объем памяти. Cosmos 3 Edge решает обе задачи. На платформе Jetson AGX Thor T5000 модель генерирует чанк действий за 1.53 секунды при разрешении 640×540 и частоте 15 Гц. Этот чанк покрывает около 2.13 секунд движения робота, что позволяет осуществлять непрерывное потоковое управление без простоя.
В закрытых симуляциях RoboLab пост-обученная политика достигла успеха в 22.9% задач, что доказывает практическую применимость 4-миллиардной модели для реального времени.
Технические характеристики обучения
Модель обучалась на датасете nvidia/Cosmos3-DROID, содержащем 76 000 успешных траекторий (около 350 часов) с манипулятором Franka Panda и захватом Robotiq. Обучение проводилось с использованием 64 узлов с чипами GB200, что потребовало ~68 часов (17.4K GB200-часов) вычислений.
| Параметр | Значение / Конфигурация |
|---|---|
| Архитектура модели | 4B omni-model (2B Nemotron reasoner) |
| Платформа развертывания | NVIDIA Jetson AGX Thor (встроенная память ~9 ГБ BF16) |
| Разрешение входа | 540×640 (3 камеры: запястье 360×640 + 2 внешних 180×320) |
| Пространство действий | 8-D абсолютные позиции (7 суставов + захват) |
| Частота предсказания | 15 Гц (чанк из 32 будущих действий) |
| Успешность в RoboLab | 22.9% (closed-loop simulation) |
| Обучающий датасет | nvidia/Cosmos3-DROID (76k траекторий, 86 задач) |
Как это работает
Процесс включает пост-обучение (post-training) базового чекпоинта Cosmos 3 Edge для предсказания действий робота. Архитектура использует свежий энкодер и декодирующий MLP с множителем скорости обучения 5x. Визуальное согласование (flow-matching) взвешено для соответствия потере действий. Развертывание осуществляется через WebSocket-сервер, использующий протокол OpenPI, что обеспечивает совместимость с экосистемой DROID.
Код для воспроизведения доступен в репозитории cosmos-framework, а чекпоинты опубликованы на HuggingFace. Это открывает путь к созданию автономных роботов, способных адаптироваться к среде в реальном времени без зависимости от серверной инфраструктуры.
Источник: NVIDIA dev blog ↗
