Революция в сенсорах: одна камера против LiDAR
Mistral AI выпустила Robostral Navigate — первую модель для воплощенной навигации (embodied navigation), способную выполнять сложные задачи по голосовым инструкциям, опираясь исключительно на данные с одной обычной RGB-камеры. В отличие от индустриального стандарта, где используются комплекты из LiDAR, глубинных камер и стереоскопических систем, Robostral Navigate обходится минимальным набором датчиков. Это не только удешевляет аппаратную часть роботов, но и повышает энергоэффективность системы.
Модель успешно справляется с навигацией в офисах, жилых комплексах, торговых центрах и на улице, обходя динамические препятствия и людей, которых не было в обучающей выборке.
Метрики и сравнение с аналогами
Ключевым показателем эффективности стала оценка на валидационном наборе R2R-CE (Room-to-Room in Continuous Environments) с разделом "unseen" (неизвестные среды). Robostral Navigate показала результат 76.6%, что является state-of-the-art для систем, использующих только один RGB-камеру. Более того, она превзошла лучшие решения, использующие глубинные сенсоры или мультикамерные системы, на 4.5 процентных пункта.
| Характеристика | Robostral Navigate (Mistral AI) | Типичные мульти-сенсорные системы |
|---|---|---|
| Датчики | Одна RGB-камера | LiDAR, глубинные камеры, стерео-пары |
| Размер модели | 8B параметров | Зависит от архитектуры (часто больше) |
| Базовая модель | Внутренний VLM для grounding | Часто на базе открытых VLM |
| Обучающие данные | ~400 000 траекторий в симуляции (6 000 сцен) | Смесь симуляции и реальных данных |
| Метод принятия решений | Pointing (указание пикселя) + локальные смещения | Метрические смещения или планирование на карте |
| Результат R2R-CE (val-unseen) | 76.6% | На 4.5 п.п. ниже (лучшие системы с глубиной) |
Инновационный метод "Pointing" и ускорение обучения
Вместо традиционного вычисления метрических перемещений (например, «иди 2 метра вперед»), модель использует метод pointing. Она предсказывает координаты целевого объекта на изображении текущей камеры. Это делает систему устойчивой к изменениям масштаба и параметров камеры. Если цель выходит из поля зрения, алгоритм переключается на локальные смещения в координатах робота.
Обучение было оптимизировано за счет алгоритма на базе prefix-caching, который сжимает целую эпизодическую последовательность в один проход. Это сократило количество токенов для обучения в 22 раза, превратив месяцы вычислений в дни. После супервизорного обучения применялся алгоритм онлайн-обучения с подкреплением CISPO, который добавил еще +3.2% к успешности навигации, позволив роботу учиться на ошибках.
Практическое применение
Благодаря универсальности архитектуры, Robostral Navigate может работать на колесных, шагающих и летающих роботах разных размеров. Это открывает возможности для:
- Логистики: автономная доставка грузов на складах.
- Производства: перемещение деталей между станциями по инструкции.
- Гостиничного сервиса: сопровождение гостей от лобби до номера.
Модель не полагается на открытые VLM, а построена с нуля на базе внутренних моделей Mistral для задач grounding (привязки объектов к пространству), что позволило сделать навигацию естественным продолжением способности модели «понимать», где находятся объекты.
Источник: MarkTechPost ↗
