Проблема хранения и новый подход к потоковой загрузке
Классический подход к обучению современных роботизированных систем требует скачивания огромных репозиториев. Датасет NVIDIA Cosmos3-DROID весит 707 ГБ, что делает его использование ресурсоемким и медленным. Новая методика, описанная в техническом руководстве, предлагает полностью потоковый (streaming) подход. Вместо локального хранения используется HTTP byte-range access через библиотеку PyArrow для выборочного чтения Parquet-файлов и PyAV/FFmpeg для декодирования только необходимых видеофрагментов (AV1) в реальном времени.
Архитектура датасета и метрики
Датасет структурирован вокруг задачи успешного выполнения манипуляций (категория success). Для демонстрации пайплайна использовалась выборка из 48 эпизодов с горизонтом планирования 8 шагов. Ключевые характеристики данных, доступные через метаданные info.json и схему LeRobotDataset v3.0:
| Параметр | Значение / Описание |
|---|---|
| Общий объем репозитория | 707 GB |
| Идентификатор репозитория | nvidia/Cosmos3-DROID |
| Ключ видео-наблюдения | observation.image.wrist_image_left |
| Частота кадров (FPS) | 15 |
| Размер визуального входа | 96x96 пикселей |
| Количество эпизодов (выборка) | 48 |
| Горизонт действий (Horizon) | 8 шагов |
Технический стек и процесс обучения
Пайплайн строится на стеке PyTorch и Hugging Face Hub. Данные преобразуются в траектории «состояние-действие» (state-action trajectories). Наблюдения и действия нормализуются с использованием статистики датасета. Архитектура модели имитирует подход ACT (Action Chunking Transformer), создавая чанковый PyTorch Dataset с опциональной визуальной условностью. Обучение проводилось в течение 12 эпох с размером батча 256 на устройстве CUDA.
Результаты оценки и значимость
Оценка обученной политики (policy) проводилась через open-loop rollout с временной ансамблевой обработкой чанков действий. Метрики эффективности включали среднеквадратичную ошибку (MSE) и коэффициент детерминации ($R^2$) по каждому суставу относительно базовой модели среднего действия. Такой подход позволяет исследователям быстро прототипировать алгоритмы поведенческого клонирования (behavior cloning), экономя терабайты дискового пространства и пропускной способности сети.
Источник: MarkTechPost ↗
