Проблема: Почему старые бенчмарки больше не работают
Современные фундаментальные модели робототехники научились выполнять сложные манипуляции по текстовым инструкциям, но оценка их реальных способностей стала «узким горлышком». NVIDIA Research выделяет четыре критических недостатка существующих подходов:
- Визуальное перекрытие (Visual Domain Overlap): Модели часто обучаются и тестируются на данных из одних и тех же симуляций. Высокий успех может означать просто запоминание сцены, а не обобщение. Реалистичные методы (например, Gaussian Splatting) требуют более часа на настройку одной сцены, что делает масштабное тестирование невозможным.
- Насыщение бенчмарков (Benchmark Saturation): Статические наборы задач быстро исчерпываются. Когда все модели показывают >90% успеха, цифры теряют смысл, и невозможно отличить действительно более сильную модель от просто хорошо подготовленной.
- Отсутствие диагностики: Бинарный результат «успех/провал» не объясняет причину ошибки. Была ли это путаница с цветом, фразировкой инструкции или смещением камеры?
- Статистическая ненадежность: Малое количество запусков (rollouts) дает широкий доверительный интервал. Например, при 70 запусках и успехе 90%, истинный показатель может варьироваться от 80.5% до 95.9%.
Решение: Архитектура RoboLab
Платформа RoboLab построена на трех принципах: робот-агностицизм, быстрая генерация задач и глубокая аналитика. Ключевые особенности:
- Robot-Agnostic Benchmarking: Задачи не привязаны к конкретному роботу (Franka, humanoid и др.). Одна и та же сцена оценивает любую политику, что устраняет зависимость от данных конкретного оборудования.
- Агентская генерация задач: Интеграция с AI-агентами позволяет создавать новые сцены и инструкции за минуты, предотвращая насыщение бенчмарка. Старые задачи можно выводить из оборота по мере развития моделей.
- Детальная метрика SPARC: Оценка не только факта выполнения, но и качества траектории (плавность движений) с помощью метрики SPARC.
- Нейро-постериорная оценка (Neural Posterior Estimation): Позволяет проводить чувствительный анализ, количественно определяя влияние переменных среды на успех политики.
Статистическая строгость и метрики
Для обеспечения достоверности результатов RoboLab рекомендует использовать метод Clopper-Pearson для построения доверительных интервалов. Ниже приведено сравнение влияния объема выборки на точность оценки:
| Количество запусков (Rollouts) | Наблюдаемый успех | 95% Доверительный интервал (Clopper-Pearson) | Ширина интервала |
|---|---|---|---|
| 70 | 90% | 80.5% – 95.9% | ±7.7% (15.4 п.п.) |
| 1,030 | 90% | 88.0% – 91.8% | ±1.9% (3.8 п.п.) |
Как видно из таблицы, для получения статистически значимого сравнения политик требуется примерно в 15 раз больше запусков, чем обычно используется в публикациях.
Интеграция с Isaac Lab-Arena
Платформа RoboLab не является изолированным инструментом. Ее функционал, включая задачи с тегами компетенций (визуальные, процедурные, реляционные), будет интегрирован в NVIDIA Isaac Lab-Arena с августа 2026 года. Это позволит исследователям использовать единый стандарт для оценки обобщающих политик (general-purpose policies) до их развертывания в реальном мире.
Источник: NVIDIA dev blog ↗
