Релиз модели14 июля 2026 г., 11:17 МСК🤖 Auto

Mistral AI выпустила Robostral Navigate: навигация роботов через одну камеру

Mistral AI представила модель Robostral Navigate (8B), позволяющую роботам ориентироваться в сложных средах, используя только одну RGB-камеру. Модель достигла 76.6% успеха на бенчмарке R2R-CE, превзойдя системы с LiDAR и глубинными сенсорами.

Баннер новости 3524

Революция в сенсорах: одна камера против LiDAR

Mistral AI выпустила Robostral Navigate — первую модель для воплощенной навигации (embodied navigation), способную выполнять сложные задачи по голосовым инструкциям, опираясь исключительно на данные с одной обычной RGB-камеры. В отличие от индустриального стандарта, где используются комплекты из LiDAR, глубинных камер и стереоскопических систем, Robostral Navigate обходится минимальным набором датчиков. Это не только удешевляет аппаратную часть роботов, но и повышает энергоэффективность системы.

Модель успешно справляется с навигацией в офисах, жилых комплексах, торговых центрах и на улице, обходя динамические препятствия и людей, которых не было в обучающей выборке.

Метрики и сравнение с аналогами

Ключевым показателем эффективности стала оценка на валидационном наборе R2R-CE (Room-to-Room in Continuous Environments) с разделом "unseen" (неизвестные среды). Robostral Navigate показала результат 76.6%, что является state-of-the-art для систем, использующих только один RGB-камеру. Более того, она превзошла лучшие решения, использующие глубинные сенсоры или мультикамерные системы, на 4.5 процентных пункта.

Характеристика Robostral Navigate (Mistral AI) Типичные мульти-сенсорные системы
Датчики Одна RGB-камера LiDAR, глубинные камеры, стерео-пары
Размер модели 8B параметров Зависит от архитектуры (часто больше)
Базовая модель Внутренний VLM для grounding Часто на базе открытых VLM
Обучающие данные ~400 000 траекторий в симуляции (6 000 сцен) Смесь симуляции и реальных данных
Метод принятия решений Pointing (указание пикселя) + локальные смещения Метрические смещения или планирование на карте
Результат R2R-CE (val-unseen) 76.6% На 4.5 п.п. ниже (лучшие системы с глубиной)

Инновационный метод "Pointing" и ускорение обучения

Вместо традиционного вычисления метрических перемещений (например, «иди 2 метра вперед»), модель использует метод pointing. Она предсказывает координаты целевого объекта на изображении текущей камеры. Это делает систему устойчивой к изменениям масштаба и параметров камеры. Если цель выходит из поля зрения, алгоритм переключается на локальные смещения в координатах робота.

Обучение было оптимизировано за счет алгоритма на базе prefix-caching, который сжимает целую эпизодическую последовательность в один проход. Это сократило количество токенов для обучения в 22 раза, превратив месяцы вычислений в дни. После супервизорного обучения применялся алгоритм онлайн-обучения с подкреплением CISPO, который добавил еще +3.2% к успешности навигации, позволив роботу учиться на ошибках.

Практическое применение

Благодаря универсальности архитектуры, Robostral Navigate может работать на колесных, шагающих и летающих роботах разных размеров. Это открывает возможности для:

  • Логистики: автономная доставка грузов на складах.
  • Производства: перемещение деталей между станциями по инструкции.
  • Гостиничного сервиса: сопровождение гостей от лобби до номера.

Модель не полагается на открытые VLM, а построена с нуля на базе внутренних моделей Mistral для задач grounding (привязки объектов к пространству), что позволило сделать навигацию естественным продолжением способности модели «понимать», где находятся объекты.

Источник: MarkTechPost ↗