Релиз модели15 сентября 2026 г., 00:16 МСК🤖 Auto

Reward AI представила OM-1: робот, обученный только на данных человека

Стартап Reward AI выпустил OM-1 — политику манипуляции, обученную исключительно на демонстрациях человека в перчатках, без использования телеоперации или данных с самих роботов. Система работает на скорости человека и поддерживает принцип «One Model,

Баннер новости 7484

Прорыв в сборе данных: Omnibody Hand и точность трекинга

В основе системы лежит перчатка Omnibody Hand с 7 степенями свободы (7-DoF), разработанная для захвата ключевых функций руки: выбора точек контакта, переориентации объектов и перехода между прецизионным и силовым захватами. В отличие от визуальных систем, Reward AI использовала гибридный подход, объединив визуально-инерциальное отслеживание с электромагнитным датчиком и компенсацией возмущений.

Это решение позволило существенно снизить ошибку при быстрых движениях. При скорости 67 см/с средняя ошибка перелета (overshoot error) электромагнитного трекинга составила 9.5 мм, тогда как визуальная система давала 24.9 мм. Это снижение ошибки на 60% при более узком разбросе результатов между запусками.

Метрика Визуально-инерциальная система Электромагнитная система (Reward AI)
Ошибка при 3 см/с ~2.1 мм ~0.4 мм
Ошибка при 67 см/с ~24.9 мм ~9.5 мм
Снижение ошибки на высокой скорости База 60%

Архитектура OM-1: Один полис, один интерфейс

Главное отличие OM-1 от большинства современных роботизированных моделей — отсутствие данных телеоперации и данных, собранных непосредственно с роботов. Обучение происходит в один этап (single-stage training) на мультимодальных потоках: изображения, тактильные сигналы, проксимити-сенсоры и траектории позы руки. Каждая модальность обрабатывается с нативной частотой дискретизации, что сохраняет высокочастотные тактильные и кинематические сигналы.

Модель генерирует действия робота напрямую, минуя промежуточные преобразования. Выходные данные включают направление движения, скорость, усилие и тайминг событий (например, начало захвата). Архитектурные детали и количество параметров не раскрываются, но заявлена новая архитектура для эффективного вывода (inference).

Управление и скорость: RL-слой на собственном такте

Под базовой политикой находится высокочастотный слой управления, обученный с подкреплением (RL) в симуляции. Этот слой отвечает за динамику, зависящую от скорости и ускорения, внешние возмущения и задержки системы. Он работает на собственном такте, независимо от вычислений политики, что предотвращает остановку движения из-за задержек инференса. Это позволяет роботу, например, открывать плотно закрытую дверь холодильника или поднимать коробки неизвестного веса, сохраняя стабильность траектории.

Практическое применение и ограничения

По заявлению Reward AI, OM-1 способна освоить новую задачу, включая сложные динамики и длинные горизонты, менее чем за 30 минут демонстраций человека. Модель универсальна: она работает на промышленных манипуляторах, шагающих гуманоидах и мобильных манипуляторах на колесах. Все опубликованные демонстрации показывают работу на скорости 1x (человеческой скорости).

Важно отметить: на данный момент OM-1 является внутренним продуктом компании. Весы, код, датасеты и API не опубликованы, поэтому разработчики не могут развернуть модель на своем оборудовании. Заявления о результатах основаны на демонстрациях, а не на публичных бенчмарках или научных статьях.

Источник: MarkTechPost ↗