Инструменты6 октября 2026 г., 03:22 МСК🤖 Auto

NVIDIA Cosmos3-DROID: Обучение роботов без скачивания 707 ГБ

Разработчики представили пайплайн потокового обучения робототехнических моделей на датасете NVIDIA Cosmos3-DROID, позволяющий тренировать нейросети, не загружая 707 ГБ данных на локальный диск.

Баннер новости 8996

Проблема хранения и новый подход к потоковой загрузке

Классический подход к обучению современных роботизированных систем требует скачивания огромных репозиториев. Датасет NVIDIA Cosmos3-DROID весит 707 ГБ, что делает его использование ресурсоемким и медленным. Новая методика, описанная в техническом руководстве, предлагает полностью потоковый (streaming) подход. Вместо локального хранения используется HTTP byte-range access через библиотеку PyArrow для выборочного чтения Parquet-файлов и PyAV/FFmpeg для декодирования только необходимых видеофрагментов (AV1) в реальном времени.

Архитектура датасета и метрики

Датасет структурирован вокруг задачи успешного выполнения манипуляций (категория success). Для демонстрации пайплайна использовалась выборка из 48 эпизодов с горизонтом планирования 8 шагов. Ключевые характеристики данных, доступные через метаданные info.json и схему LeRobotDataset v3.0:

Параметр Значение / Описание
Общий объем репозитория 707 GB
Идентификатор репозитория nvidia/Cosmos3-DROID
Ключ видео-наблюдения observation.image.wrist_image_left
Частота кадров (FPS) 15
Размер визуального входа 96x96 пикселей
Количество эпизодов (выборка) 48
Горизонт действий (Horizon) 8 шагов

Технический стек и процесс обучения

Пайплайн строится на стеке PyTorch и Hugging Face Hub. Данные преобразуются в траектории «состояние-действие» (state-action trajectories). Наблюдения и действия нормализуются с использованием статистики датасета. Архитектура модели имитирует подход ACT (Action Chunking Transformer), создавая чанковый PyTorch Dataset с опциональной визуальной условностью. Обучение проводилось в течение 12 эпох с размером батча 256 на устройстве CUDA.

Результаты оценки и значимость

Оценка обученной политики (policy) проводилась через open-loop rollout с временной ансамблевой обработкой чанков действий. Метрики эффективности включали среднеквадратичную ошибку (MSE) и коэффициент детерминации ($R^2$) по каждому суставу относительно базовой модели среднего действия. Такой подход позволяет исследователям быстро прототипировать алгоритмы поведенческого клонирования (behavior cloning), экономя терабайты дискового пространства и пропускной способности сети.

Источник: MarkTechPost ↗