Революция в сборе данных: от лаборатории к браузеру
Команда Axis Robotics совместно с UC Berkeley, Georgia Tech и NTU представила AXIS — систему, которая переносит процесс сбора демонстраций для обучения роботов из закрытых лабораторий в веб-браузер. В отличие от традиционных подходов, где эксперты собирают данные на физическом оборудовании, AXIS позволяет пользователям телеуправлять виртуальным манипулятором Franka Research 3 через интерфейс MuJoCo WebAssembly. Это решает проблему «узкого горлышка» в развитии Physical AI, где датасеты растут медленнее, чем сами модели.
Архитектура и масштаб данных
Система построена на принципе асимметрии: тяжелые вычисления (рендеринг на 8x RTX 4090, обучение на 8x A100) происходят на бэкенде, а фронтенд отвечает только за ввод. Датасет включает 207 задач и 50 129 эпизодов (траекторий), собранных более чем 70 000 участниками. Задачи генерируются автоматически через TaskGen, который декомпозирует языковые инструкции, создает 3D-модели и валидирует сцены. Данные доступны на Hugging Face объемом 2.36 ТБ (ограничено для некоммерческого академического использования).
Качество данных и компромиссы
Очистка данных — критический этап. Алгоритмы отбрасывают статичные сэмплы (вариация суставов < 5e-3), сглаживают движение фильтром Савицкого-Голея и ресемплируют частоту до 20 Гц. Однако это приводит к компромиссам: среднее ускорение падает на 63.9%, а рывок (jerk) — на 80.8%. Успешность воспроизведения траекторий снижается с 100% до 86.2%, что документировано в исследовании.
Результаты на бенчмарке LIBERO-Plus
Модель π0.5 (бэкбоун PaliGemma Gemma-2B + эксперт действий Gemma-300M) была дообучена на данных AXIS. Результаты показывают значительный прирост точности по сравнению с базовой версией и конкурентами:
| Модель / Конфигурация | LIBERO-Plus Score | Примечание |
|---|---|---|
| Vanilla π0.5 | 83.9 | Базовая линия |
| π0.5 + AXIS-100% | 88.8 | Прирост +4.9 п.п. |
| RoboCasa365 (volume-matched) | 57.5 | Контроль по объему данных |
| π0.5 + AXIS-50% | 85.7 | Масштабирование работает |
Наибольший прирост наблюдается в категориях Sensor Noise (+13.7) и Camera (+11.3), что подтверждает эффективность пайплайна аугментации. Однако категории Light и Language показали регрессию, указывая на зоны для дальнейшей оптимизации генерации сцен.
Источник: MarkTechPost ↗
