Разработка гуманоидных роботов долгое время оставалась областью, где передовые идеи искусственного интеллекта сталкивались с суровой реальностью инженерных ограничений. Пока одни команды тратили месяцы на настройку инфраструктуры, другие пытались интегрировать разрозненные инструменты, несовместимые форматы данных и ручные скрипты, чтобы заставить робота просто взять предмет. Сегодня этот ландшафт меняется. NVIDIA представляет платформу Isaac GR00T Development Platform — открытую, модульную и полностью интегрированную среду, которая охватывает весь жизненный цикл разработки политик (policies) для гуманоидных роботов. От настройки симуляции до сбора данных через телеоперацию, обучения моделей и финального развертывания на бортовых компьютерах Jetson — всё это теперь работает как единый конвейер.
Особое внимание в обновлении GR00T 1.7 уделено модели Vision-Language-Action (VLA), которая обучена на огромных массивах данных, включающих десятки тысяч часов реальных демонстраций людей и симуляций. Это позволяет роботам не просто выполнять жестко заданные алгоритмы, а демонстрировать способность к рассуждению, обобщению навыков и адаптации к новым задачам. В этой статье мы подробно разберем архитектуру платформы, ключевые нововведения версии 1.7 и пошаговый процесс создания политики для задачи «взять и переместить» (pick-and-place), используя реальные примеры кода и конфигураций.
01Почему экосистема робостроения нуждается в унификации?
По мере того как все больше команд переходят от этапа «пробуждения» (bring-up) гуманоидных роботов к разработке конкретных навыков, потребность в воспроизводимых рабочих процессах становится критической. Построение гуманоидов остается сложнейшей задачей, а современные конвейеры разработки фрагментированы. Разработчики тратят значительную часть времени не на создание интеллектуальных способностей робота, а на конфигурирование инфраструктуры и борьбу с несовместимостью инструментов.
Хотя в сообществе робототехники существуют мощные инструменты для отдельных этапов пайплайна, их объединение в бесшовный рабочий процесс остается вызовом из-за изолированных программных экосистем, несовместимых форматов данных и необходимости ручной интеграции. Именно для решения этой проблемы NVIDIA представила платформу Isaac GR00T. Она унифицирует каждый этап пайплайна, позволяя командам использовать как отдельные компоненты, так и полный конвейер, интегрируя собственные инструменты в проверенный стек NVIDIA.
02Архитектура платформы: от симуляции к железу
Платформа Isaac GR00T помогает разработчикам масштабировать сбор данных и обучение на основе симуляции, чтобы разрабатывать, проверять и развертывать политики на реальных роботах. Давайте рассмотрим, какие технологии NVIDIA задействованы на каждом этапе этого процесса.

1. Настройка среды симуляции (Simulation Environment Setup)
Первый шаг — создание виртуальной среды для генерации данных, обучения политик и тестирования. Здесь используется NVIDIA Isaac Lab-Arena. Эта среда позволяет создавать сложные сцены с объектами и роботами, определять задачи и подключать устройства телеоперации. Важно отметить, что симуляция должна максимально точно отражать физику реального мира, чтобы политика, обученная в ней, могла быть перенесена на физический робот (sim-to-real transfer).
2. Создание данных (Data Creation)
Качество данных определяет качество модели. Для захвата высококачественных демонстраций действий робота используется NVIDIA Isaac Teleop. Этот инструмент позволяет оператору управлять роботом в симуляции (или на реальном устройстве) с помощью VR-шлема, записывая траектории движений. Эти данные становятся основой для обучения модели.
3. Обучение политик (Policy Training)
Сердцем системы является NVIDIA Isaac GR00T 1.7 вместе со скриптами обучения. Эта модель обучает робота рассуждению и многозадачному поведению, используя как данные из симуляции, так и реальные демонстрации. Модель является VLA (Vision-Language-Action), что означает, что она принимает на вход изображения, языковые инструкции и состояние робота, а на выходе генерирует управляющие действия.
4. Оценка политик (Policy Evaluation)
Прежде чем развертывать политику на реальном роботе, необходимо протестировать ее в симуляции. Для этого снова используется NVIDIA Isaac Lab-Arena. Это позволяет выявить ошибки, оценить надежность выполнения задачи и собрать метрики без риска повреждения дорогостоящего оборудования.
5. Развертывание политик (Policy Deployment)
Финальный этап — перенос обученной модели на бортовой компьютер робота. Здесь используются NVIDIA Isaac ROS и Jetson Thor. Модель экспортируется в формат LEAPP bundle, оптимизированный для работы в реальном времени (real-time) и выполнения выводов (inference) непосредственно на устройстве. Это обеспечивает низкую задержку и высокую энергоэффективность, критически важные для мобильных роботов.
03Что нового в GR00T 1.7: Архитектура и возможности
Версия 1.7 представляет собой значительный скачок вперед по сравнению с предыдущими релизами. Это первая открытая коммерчески пригодная VLA-модель для обобщенных навыков гуманоидных роботов, выпущенная под лицензией Apache 2.0. Модель является кросс-эмбодиментной (cross-embodiment), то есть она способна работать с разными типами роботов, принимая мультимодальный ввод (язык, изображения) и генерируя необходимые действия.

Основные нововведения
- Улучшенное предобучение на видео людей: Модель обучена на ~32 000 часов реальных демонстраций и данных от первого лица (ego-centric), а также на ~8 000 часов симуляционных запусков из наборов данных BEHAVIOR, RoboCasa и симулированного робота GR-1. Это делает движения робота более естественными и человекоподобными.
- Новый бэкбоун VLM: Вместо предыдущего бэкбона Eagle используется Cosmos-Reason2-2B (на архитектуре Qwen3-VL). Это поддерживает гибкое разрешение изображений и кодирует их в их естественном соотношении сторон без необходимости дополнения (padding), что улучшает качество визуального восприятия.
- Расширенная поддержка развертывания: Добавлена полная поддержка экспорта в ONNX и TensorRT. Это обеспечивает надежность экспорта и позволяет получать более частые обновления, что критично для промышленного использования.
- Улучшенное рассуждение: Благодаря декомпозиции задач на уровне задачи и подзадачи, модель стала лучше справляться с долгосрочными (long-horizon) задачами. Это повышает надежность, качество движений и способность к обобщению между разными типами роботов.
- Улучшенные бенчмарки: По сравнению с версией N1.6, модель демонстрирует стабильные улучшения в тестах DROID и SimplerEnv. Например, прирост составил +10% по DROID-F0 и впечатляющие +61% по DROID-F6, а также +5% по SimplerEnv Bridge и +2% по Fractal.
Модель доступна через GitHub и Hugging Face, с открытыми весами и базовым чекпоинтом объемом 3 миллиарда параметров.
04Практическое руководство: Задача «Взять и переместить»
Давайте перейдем от теории к практике. Мы рассмотрим симуляционный рабочий процесс для создания простой задачи pick-and-place (взять яблоко и положить на тарелку), используя платформу GR00T и модель 1.7. Этот процесс включает настройку среды, сбор данных, конвертацию, дообучение (post-training) и оценку.

Шаг 1: Настройка среды
Перед сбором данных необходимо настроить сцену. В нашем примере робот стоит перед полкой и использует руки, чтобы переместить яблоко на тарелку. Для удержания баланса используется Whole Body Controller (WBC). Поскольку робот не ходит в этой задаче, мы используем AGILE WBC — единый сквозной полис, который лучше подходит для статичных задач, чем контроллеры ходьбы.
Выбор WBC важен заранее: во время телеоперации AGILE WBC и PinkIK генерируют целевые значения для суставов, которые становятся обучающим сигналом для политики. Разный контроллер даст другое распределение данных для одного и того же движения.
Высокоуровневая реализация настройки сцены выглядит следующим образом:
background = self.asset_registry.get_asset_by_name("galileo_locomanip")()
pick_up_object = self.asset_registry.get_asset_by_name(args_cli.object)()
destination = self.asset_registry.get_asset_by_name(args_cli.destination)()
embodiment = self.asset_registry.get_asset_by_name(args_cli.embodiment)(
enable_cameras=args_cli.enable_cameras
teleop_device = (
self.device_registry.get_device_by_name(args_cli.teleop_device)()
if args_cli.teleop_device is not None else None
scene = Scene(assets=[background, pick_up_object, destination])
task = PickAndPlaceTask(
pick_up_object=pick_up_object,
destination_location=destination,
background_scene=background,
return IsaacLabArenaEnvironment(
name=self.name,
embodiment=embodiment,
scene=scene,
task=task,
teleop_device=teleop_deviceШаг 2: Сбор демонстраций
Используя Isaac Teleop, мы захватываем данные демонстраций. Оператор управляет роботом через VR-шлем с использованием CloudXR для потоковой передачи. Качество данных здесь так же важно, как и их количество. Нужно стремиться к чистым демонстрациям с плавными движениями, стабильными захватами и разнообразными направлениями подхода.
Для этой задачи мы собрали 400 траекторий, объединенных из нескольких сессий. Успешные демонстрации сохраняются в файл HDF5.
python isaaclab_arena/scripts/imitation_learning/record_demos.py \
--viz kit \
--device cpu \
--enable_cameras \
--dataset_file $DATASET_DIR/arena_g1_static_apple_dataset_recorded.hdf5 \
--num_demos 400 \
--num_success_steps 10 \
--disable_full_sim_buffer_reset \
galileo_g1_static_pick_and_place \
--object apple_01_objaverse_robolab \
--destination clay_plates_hot3d_robolab \
--teleop_device openxr
Шаг 3: Конвертация формата данных
Модель GR00T 1.7 потребляет данные в формате LeRobot. Поэтому записанный файл HDF5 необходимо конвертировать внутри контейнера Arena. Конвертация управляется конфигурационным файлом g1_static_apple_config.yaml, который сопоставляет записанные поля с тем, что ожидает GR00T.
Пример конфигурации:
# Input/Output paths
data_root: /datasets/isaaclab_arena/static_apple_tutorial
hdf5_name: "arena_g1_static_apple_dataset_recorded.hdf5"
# Task description
language_instruction: "move the apple to the plate"
task_index: 3
# Data field mappings
state_name_sim: "robot_joint_pos"
action_name_sim: "processed_actions"
pov_cam_name_sim: "robot_head_cam_rgb"
# Output configuration
fps: 50
chunks_size: 1000Запуск конвертации:
python isaaclab_arena_gr00t/lerobot/convert_hdf5_to_lerobot.py \
--yaml_file isaaclab_arena_gr00t/config/g1_static_apple_config.yamlВ результате создается папка lerobot, содержащая файлы parquet с состояниями и действиями, записи камер в формате MP4 и метаданные набора данных.
Шаг 4: Дообучение (Post-training) GR00T 1.7
Дообучение выполняется вне контейнера Arena, в отдельной копии репозитория Isaac-GR00T. Команда тонкой настройки настраивает визуальный бэкбоун, проектор и диффузионную модель, оставляя языковую модель замороженной (frozen). Это экономит вычислительные ресурсы и фокусирует обучение на адаптации к конкретной задаче.
uv run python -m torch.distributed.run --nproc_per_node=1 --standalone \
gr00t/experiment/launch_finetune.py \
--base-model-path nvidia/GR00T-N1.7-3B \
--dataset-path $DATASET_DIR/arena_g1_static_apple_dataset_recorded/lerobot \
--output-dir $MODELS_DIR/static_apple_n17_finetune \
--modality-config-path /path/to/IsaacLab-Arena/isaaclab_arena_gr00t/embodiments/g1/g1_sim_wbc_data_gr00t_n_1_7_config.py \
--embodiment-tag new_embodiment \
--global-batch-size 12 \
--max-steps 20000 \
--num-gpus 1 \
--save-steps 5000 \
--save-total-limit 5 \
--no-tune-llm \
--tune-visual \
--tune-projector \
--tune-diffusion-model \
--dataloader-num-workers 8 \
--color-jitter-params brightness 0.3 contrast 0.4 saturation 0.5 hue 0.08Шаг 5: Оценка политики
После дообучения оценка состоит из двух шагов: загрузка чекпоинта в сервер GR00T и запуск политики в замкнутом цикле. Arena использует архитектуру клиент-сервер, где сервер хостит дообученную модель, а клиент Arena запускает симуляцию и запрашивает модель.
Запуск клиента оценки:
/isaac-sim/python.sh isaaclab_arena/evaluation/policy_runner.py \
--viz kit \
--policy_type isaaclab_arena_gr00t.policy.gr00t_remote_closedloop_policy.Gr00tRemoteClosedloopPolicy \
--policy_config_yaml_path isaaclab_arena_gr00t/policy/config/g1_static_apple_gr00t_closedloop_config.yaml \
--remote_host <SERVER_HOST> --remote_port 5555 \
--num_steps 600 \
--enable_cameras \
galileo_g1_static_pick_and_place \
--object apple_01_objaverse_robolab \
--destination clay_plates_hot3d_robolab \
--embodiment g1_wbc_agile_jointМетрики выводятся в консоль. Пример успешного результата:
[Rank 0/1] Metrics: {'success_rate': 1.0, 'object_moved_rate': 1.0, 'num_episodes': 1}Для более репрезентативной оценки можно изменить флаги: --num_steps устанавливает длину руллуа (600 шагов — это быстрый smoke test), а --num_episodes 100 (или 1000 для сильной оценки) позволяет оценить полный успех. Флаг --num_envs 5 запускает среды параллельно для большей рандомизации.

05Растущая экосистема GR00T
Платформа GR00T и эталонный рабочий процесс уже внедряются в растущей экосистеме партнеров по гуманоидной робототехнике. Среди производителей гуманоидов и поставщиков ИИ, использующих компоненты платформы, такие компании, как 1X, Agility Robotics, ANYbotics, Bellboy Robotics, FieldAI, Lightwheel AI, NEURA Robotics, Nexuni и Noble.
Эта широкая поддержка свидетельствует о том, что GR00T становится стандартом де-факто для разработки умных гуманоидов. Интеграция с ROS, поддержка различных типов роботов и открытость кода делают платформу привлекательной как для исследовательских институтов, так и для коммерческих разработчиков.
06Что это значит на практике
Для разработчиков роботов внедрение NVIDIA Isaac GR00T 1.7 означает радикальное сокращение времени от идеи до работающего прототипа. Вместо того чтобы писать сотни строк кода для каждого нового навыка, инженеры могут использовать предобученную модель, которая уже «понимает» физику мира и базовые манипуляции. Задача сводится к сбору качественных данных (даже в небольшом объеме) и тонкой настройке модели под конкретную задачу.
Для бизнеса это означает возможность масштабирования. Единый рабочий процесс позволяет легко переносить навыки, отработанные в симуляции, на реальные роботы разных производителей благодаря кросс-эмбодиментной природе модели. Оптимизация через TensorRT и Jetson Thor гарантирует, что эти сложные AI-политики будут работать быстро и энергоэффективно на борту, открывая путь к коммерческому развертыванию гуманоидов в складской логистике, производстве и обслуживании.
В конечном итоге, GR00T устраняет барьеры между симуляцией и реальностью, делая разработку «умных» роботов более доступной, воспроизводимой и эффективной.
Источник: NVIDIA Developer ↗
