Проблема традиционного программирования роботов
Традиционное программирование роботов требует ручной настройки мультимодального восприятия, динамики контактов и обработки сбоев. Существующие агенты на базе языковых моделей (LLM) часто работают в «наивных» средах: они получают только грубую обратную связь (успех/неудача), не понимая корневой причины ошибки. Более того, они забывают полученные знания после завершения задачи, что делает невозможным накопление опыта.
Как работает ASPIRE
ASPIRE (Agentic Skill Programming through Iterative Robot Exploration) решает эти проблемы через архитектуру «координатор-исполнитель» и замкнутый цикл обучения. Ключевые компоненты системы:
- Двигатель замкнутого цикла: Заменяет грубую обратную связь детализированными мультимодальными трассами. Для каждого шага (восприятие, планирование, управление) сохраняются входные/выходные данные, RGB-кадры, кандидаты на захват и результаты планирования движения. Агенты анализируют только те вызовы, которые привели к сбою.
- Библиотека навыков: Успешные исправления (хэвристики локализации, промпты восприятия, примитивы движения) сохраняются как компактные инструкции. Координатор допускает в библиотеку только те паттерны, которые прошли проверку отладки.
- Эволюционный поиск: Чтобы избежать локальных оптимумов, ASPIRE генерирует K кандидатов на каждом этапе, основываясь на лучших предыдущих программах, но исследуя различные стратегии, а не просто уточняя одну.
Технические детали и стек
В симуляции агентом выступает Claude Code с моделью Claude Opus 4.6 и контекстным окном в 1 млн токенов. Программы пишутся на языке CaP-X (Code-as-Policy) в среде MuJoCo Playground. Важное ограничение: агенту запрещено читать «истину» симулятора (физические состояния, файлы .xml, .urdf). Разрешено только то, что доступно реальной камере робота.
Результаты бенчмарков
ASPIRE демонстрирует прорывные результаты на трех основных наборах данных: LIBERO-Pro, Robosuite и BEHAVIOR-1K. Система значительно превосходит как end-to-end политики (OpenVLA, π0), так и предыдущих агентов CaP-Agent0.
| Метрика / Бенчмарк | End-to-end VLAs (OpenVLA, π0, π0.5) | CaP-Agent0 (Базовый) | ASPIRE (Новый) |
|---|---|---|---|
| LIBERO-Pro (Overall) | 0–13% | 18% | 72% |
| LIBERO-Pro Long (Zero-Shot) | 0–5% | ~4% | ~31% |
| Robosuite (Bimanual Handover) | Информация недостаточна | 20% | 92% |
| BEHAVIOR-1K (Radio Pickup) | Информация недостаточна | 56% | 88% |
Особое внимание привлекает результат в zero-shot сценарии: переиспользуя навыки, накопленные на наборе LIBERO-90, ASPIRE достигает ~31% успеха на новых задачах LIBERO-Pro Long, тогда как предыдущие методы saturate на уровне 4%.
Перенос на реального робота
Исследователи протестировали навыки, найденные в симуляции, на реальной бимануальной станции YAM. Агентами выступали модели OpenAI Codex GPT-5.5. Перенос знаний позволил сократить затраты на отладку в 10 раз (по количеству токенов). Например, задача подъема банки с газировкой улучшилась с 13/20 до 19/20 успешных попыток, а открытие ящика — с 0/20 до 11/20, где базовая линия не справлялась вовсе.
Бенчмарки
| Бенчмарк | ASPIRE | CaP-Agent0 | Prior methods |
|---|---|---|---|
| Robosuite Bimanual Handover | 92% | 20% | — |
| BEHAVIOR-1K Radio Pickup | 88% | 56% | — |
| LIBERO-Pro Long Zero-Shot | 31% | — | 4% |
Жирным — лучший результат в строке. Источник цифр — официальная публикация.
Источник: MarkTechPost ↗
