Проблема «эмбодимент-разрыва»
Ключевым ограничением в области воплощенного ИИ (embodied AI) является не архитектура моделей, а нехватка качественных данных. Хотя в интернете существуют миллиарды видео с манипуляциями людей, роботы не могут напрямую учиться по ним из-за различий в морфологии: руки человека и манипуляторы роботов имеют разную кинематику и ограничения.
Архитектура Pegasus
Авторы предлагают фреймворк Pegasus, который переводит человеческие демонстрации в формат, понятный роботам. Вместо использования сырых видеопромптов система строит промежуточное графовое представление:
- Task Graph: извлекается из исходных видео с участием людей.
- Affordance и Constraint Graphs: трансформируют задачу, учитывая физические свойства объектов и среды.
- Robot Planning Graph: финальный граф, адаптированный под конкретные условия робота для генерации видео.
Иерархическое латентное пространство аффордансов моделирует связи между состояниями объектов, их функциональностью и задачами, что позволяет системе обобщать знания независимо от конкретных идентификаторов объектов.
Физическая верификация
Для обеспечения реалистичности генерации Pegasus использует замкнутый цикл с физическим верификатором. Он отфильтровывает некорректные генерации, проверяя их на:
- Кинематическую выполнимость (feasibility).
- Отсутствие коллизий (collision constraints).
- Соблюдение лимитов суставов (joint limits).
Результаты и значимость
Оценка Pegasus проводилась на бенчмарках манипуляций от первого лица (GTEA Gaze+ и EPIC-KITCHENS-100) с использованием различных роботизированных платформ. Метрики Task Correctness, Executability, State Consistency и Learnability подтвердили надежность кросс-эмбодиментного перевода. Работа доказывает, что генерация данных для роботов может быть переосмыслена как масштабируемая задача передачи знаний, а не проблема сбора «железа».
Источник: arXiv cs.AI ↗
