Релиз модели4 июля 2026 г., 10:16 МСК🤖 Auto

NVIDIA представила ASPIRE: роботы, которые учатся на ошибках

NVIDIA, совместно с ведущими университетами, выпустила фреймворк ASPIRE. Это система непрерывного обучения, которая не просто пишет код для роботов, но и сохраняет успешные решения в библиотеку навыков, достигая 31% успеха в zero-shot сценариях.

Баннер новости 2893

Проблема традиционного программирования роботов

Традиционное программирование роботов требует ручной настройки мультимодального восприятия, динамики контактов и обработки сбоев. Существующие агенты на базе языковых моделей (LLM) часто работают в «наивных» средах: они получают только грубую обратную связь (успех/неудача), не понимая корневой причины ошибки. Более того, они забывают полученные знания после завершения задачи, что делает невозможным накопление опыта.

Как работает ASPIRE

ASPIRE (Agentic Skill Programming through Iterative Robot Exploration) решает эти проблемы через архитектуру «координатор-исполнитель» и замкнутый цикл обучения. Ключевые компоненты системы:

  • Двигатель замкнутого цикла: Заменяет грубую обратную связь детализированными мультимодальными трассами. Для каждого шага (восприятие, планирование, управление) сохраняются входные/выходные данные, RGB-кадры, кандидаты на захват и результаты планирования движения. Агенты анализируют только те вызовы, которые привели к сбою.
  • Библиотека навыков: Успешные исправления (хэвристики локализации, промпты восприятия, примитивы движения) сохраняются как компактные инструкции. Координатор допускает в библиотеку только те паттерны, которые прошли проверку отладки.
  • Эволюционный поиск: Чтобы избежать локальных оптимумов, ASPIRE генерирует K кандидатов на каждом этапе, основываясь на лучших предыдущих программах, но исследуя различные стратегии, а не просто уточняя одну.

Технические детали и стек

В симуляции агентом выступает Claude Code с моделью Claude Opus 4.6 и контекстным окном в 1 млн токенов. Программы пишутся на языке CaP-X (Code-as-Policy) в среде MuJoCo Playground. Важное ограничение: агенту запрещено читать «истину» симулятора (физические состояния, файлы .xml, .urdf). Разрешено только то, что доступно реальной камере робота.

Результаты бенчмарков

ASPIRE демонстрирует прорывные результаты на трех основных наборах данных: LIBERO-Pro, Robosuite и BEHAVIOR-1K. Система значительно превосходит как end-to-end политики (OpenVLA, π0), так и предыдущих агентов CaP-Agent0.

Метрика / Бенчмарк End-to-end VLAs (OpenVLA, π0, π0.5) CaP-Agent0 (Базовый) ASPIRE (Новый)
LIBERO-Pro (Overall) 0–13% 18% 72%
LIBERO-Pro Long (Zero-Shot) 0–5% ~4% ~31%
Robosuite (Bimanual Handover) Информация недостаточна 20% 92%
BEHAVIOR-1K (Radio Pickup) Информация недостаточна 56% 88%

Особое внимание привлекает результат в zero-shot сценарии: переиспользуя навыки, накопленные на наборе LIBERO-90, ASPIRE достигает ~31% успеха на новых задачах LIBERO-Pro Long, тогда как предыдущие методы saturate на уровне 4%.

Перенос на реального робота

Исследователи протестировали навыки, найденные в симуляции, на реальной бимануальной станции YAM. Агентами выступали модели OpenAI Codex GPT-5.5. Перенос знаний позволил сократить затраты на отладку в 10 раз (по количеству токенов). Например, задача подъема банки с газировкой улучшилась с 13/20 до 19/20 успешных попыток, а открытие ящика — с 0/20 до 11/20, где базовая линия не справлялась вовсе.

Бенчмарки

БенчмаркASPIRECaP-Agent0Prior methods
Robosuite Bimanual Handover92%20%
BEHAVIOR-1K Radio Pickup88%56%
LIBERO-Pro Long Zero-Shot31%4%

Жирным — лучший результат в строке. Источник цифр — официальная публикация.

Источник: MarkTechPost ↗