Робототехника стоит на пороге новой эры, где границы между симуляцией и реальностью стираются благодаря передовым языково-визуально-моторным моделям (VLA). Выход версии 0.6.0 библиотеки LeRobot от Hugging Face — это не просто очередное техническое обновление, а фундаментальный сдвиг в парадигме обучения роботов. Теперь акцент смещается с простого копирования движений на способность роботов «воображать» будущее, оценивать свои действия и непрерывно улучшаться на основе ошибок. Это закрытие цикла обучения: от предсказания следующего кадра до автоматического сбора данных во время развертывания.
В этой статье мы подробно разберем все ключевые нововведения LeRobot v0.6.0. Мы поговорим о мир-моделях, которые учатся предвидеть последствия своих действий, о новых моделях семейства VLA, включая GR00T N1.7 и MolmoAct2, а также об инструментах для оценки и развертывания. Особое внимание уделим практическим аспектам: как запустить обучение в облаке, как использовать глубину с камер Intel RealSense и как настроить сбор данных с помощью стратегии DAgger. Если вы работаете с роботами в России или других регионах с ограничениями на доступ к облачным ресурсам, мы также отметим возможности локального запуска и оптимизации.
01Мир-модели: политики, которые воображают будущее
Один из главных вопросов современной робототехники: действительно ли мир-модели (world models) помогают политикам роботов принимать более эффективные решения? Версия 0.6.0 отвечает на этот вопрос, предоставляя три новые политики, которые учатся «воображать» будущее как часть процесса обучения. Каждая из них использует свой подход, чтобы сделать эти вычисления эффективными и доступными.
VLA-JEPA
VLA-JEPA — это компактная VLA-модель, построенная на базе Qwen3-VL-2B. Ее уникальность заключается в том, что во время обучения она использует JEPA-мир-модель для предсказания будущих кадров в латентном пространстве. Проще говоря, модель учится предвидеть, как изменится сцена после ее действий. Ключевой трюк заключается в том, что на этапе инференса (вывода) мир-модель исчезает, что позволяет получить преимущество обучения без дополнительных вычислительных затрат. Это означает, что вы можете использовать предварительно обученные чекпоинты, например, на базе набора данных DROID, для тонкой настройки под свои задачи.
Для начала работы с VLA-JEPA используйте следующую команду:
lerobot-train \
--policy.path=lerobot/VLA-JEPA-Pretrain \
--dataset.repo_id=${HF_USER}/my_dataset \
--policy.repo_id=${HF_USER}/my_finetuned_policyЭтот подход позволяет интегрировать знания о физике мира в политику робота, не замедляя его работу в реальном времени. Подробнее о технических деталях можно узнать в документации VLA-JEPA и соответствующей научной статье.
LingBot-VA
LingBot-VA идет еще дальше, представляя собой авторегрессионную видео-модель действий. Она предсказывает будущие видео и действия одновременно, блоками, и постоянно подпитывает свое воображение реальными наблюдениями, чтобы оставаться «заземленной» в реальности. Это особенно полезно для задач, требующих долгосрочного планирования. Интересная возможность этой модели — сохранение того, что робот «представил», для сравнения с тем, что произошло на самом деле. Инференс выполняется на одной видеокарте с 24–32 ГБ памяти, что делает ее доступной для многих исследователей.
FastWAM
FastWAM задает провокационный вопрос: действительно ли мир-модели действий нуждаются в воображении будущего во время тестирования? Эта модель объединяет эксперта по генерации видео (~5B параметров) и компактного эксперта по действиям в одной сети. Модель буквально учится «мечтать» свои собственные пролеты (rollouts). Однако на этапе инференса она пропускает этап «мечтаний» и напрямую денормализует чанки действий. Это позволяет достичь высокой скорости и точности без накладных расходов на симуляцию будущего. Вы можете начать с базового чекпоинта lerobot/fastwam_base.
02VLA: Зоопарк моделей продолжает расти
LeRobot v0.6.0 значительно расширяет библиотеку поддерживаемых моделей, предлагая решения для различных задач и вычислительных мощностей. Давайте рассмотрим самые интересные новинки.
GR00T N1.7
Интеграция NVIDIA GR00T была обновлена до версии N1.7 — новейшей открытой генерации кросс-эмбодиментной фундаментальной модели от NVIDIA. В этой версии предыдущая VLM была заменена на Cosmos-Reason2-2B (построенную на базе Qwen3-VL), которая питает головку действий с использованием flow-matching. Интеграция LeRobot протестирована на паритет с оригинальной реализацией NVIDIA Isaac-GR00T: те же входные данные, те же выходные данные. Теперь Flash-attention является опциональным, поэтому команда pip install 'lerobot[groot]' работает «из коробки», и вы можете загружать опубликованные чекпоинты NVIDIA напрямую. Обратите внимание, что GR00T N1.7 заменяет N1.5 в LeRobot. Если вам нужна старая версия, закрепите lerobot==0.5.1.
MolmoAct2
MolmoAct2 от Allen Institute for AI теперь портирован в LeRobot с полным жизненным циклом: тонкая настройка (полная или через LoRA), оценка и развертывание на реальном роботе. Готовые чекпоинты с встроенной калибровкой позволяют запускать модель в режиме zero-shot на роботах SO-100/101. Инференс помещается в ~12 ГБ памяти при bf16, а тонкая настройка через LoRA — на одной видеокарте с 24 ГБ. Пример команды для развертывания:
lerobot-rollout \
--policy.path=lerobot/MolmoAct2-SO100_101-LeRobot \
--robot.type=so100_follower \
--robot.port=/dev/ttyACM0 \
--robot.cameras='{cam0: {type: opencv, index_or_path: 0, width: 640, height: 480, fps: 30}, cam1: {type: opencv, index_or_path: 2, width: 640, height: 480, fps: 30}}' \
--task="pick up the red cube" \
--duration=30EO-1
EO-1 — это VLA, предварительно обученная на интерлированном данных (видео-текст-действия). Она использует бэкбон Qwen2.5-VL-3B с головкой действий на основе flow-matching. Модель была внесена в репозиторий одним из авторов оригинальной статьи. Обучение осуществляется через стандартный рабочий процесс lerobot-train с указанием --policy.type=eo1.
Multitask DiT
Эта политика приносит рецепт TRI Large Behavior Models в LeRobot. Это диффузионный трансформер (~450M параметров), который условно управляется визуальными и языковыми эмбеддингами CLIP. Одна модель учится выполнять множество задач, выбираемых через естественный язык. Она поддерживает как диффузионные, так и flow-matching цели и достаточно мала, чтобы вы могли обучить ее самостоятельно.
EVO1
VLA не обязательно должны быть огромными. EVO1 упаковывает свою политику в 0.77B параметров, используя бэкбон InternVL3-1B и головку действий flow-matching. Она достаточно мала для тонкой настройки и работы в реальном времени на скромных видеокартах. Модель поставляется с поддержкой двухэтапной тонкой настройки и Real-Time Chunking из коробки.

03Модели вознаграждения: знание того, когда робот преуспевает
Обнаружение успеха и оценка прогресса были недостающими звеньями в цикле обучения роботов. Версия 0.6.0 решает эту проблему, предоставляя единый API для моделей вознаграждения (lerobot.rewards), аналогичный API для политик. Теперь доступны четыре модели вознаграждения, включая две новые: Robometer и TOPReward.
Robometer
Robometer — это предварительно обученная общая модель вознаграждения. Если вы укажете lerobot/Robometer-4B на любой набор данных LeRobot, она оценит прогресс задачи и успех на основе сырого видео и языковой инструкции, без необходимости специфичной для задачи тренировки. Модель построена на базе Qwen3-VL-4B и обучена через сравнение траекторий на наборе данных из более чем миллиона роботизированных траекторий. Это позволяет использовать ее как универсальный инструмент для оценки качества данных и прогресса обучения.
TOPReward
TOPReward идет по пути полного zero-shot: ей не нужны веса вознаграждения. Она оборачивает готовую VLM (Qwen3-VL) и читает логарифмическую вероятность токена «True» для видео траектории и инструкции задачи. Любая способная VLM становится функцией вознаграждения. Обе модели поставляются со скриптами разметки, которые записывают кривые прогресса по кадрам в ваш набор данных, готовые для использования в поведенческом клонировании,awareness of reward (RA-BC), проверке качества данных и создании видео с наложением прогресса.

04Наборы данных: быстрая загрузка, богатые данные
Работа с данными — это основа обучения роботов. LeRobot v0.6.0 предлагает значительные улучшения в скорости загрузки и богатстве информации.
Ваш кодек, ваши правила
Запись больше не ограничена одним жестко закодированным кодеком. Новые параметры --dataset.rgb_encoder.* открывают полный спектр кодирования (кодек, качество, формат пикселей, GOP, пресеты). Параметр vcodec=auto автоматически ищет аппаратные энкодеры, такие как NVENC, VideoToolbox, VAAPI и QSV, прежде чем вернуться к программному энкодеру AV1 по умолчанию. Для существующих наборов данных доступна одна команда для перекодирования всего:
lerobot-edit-dataset \
--repo_id ${HF_USER}/my_dataset \
--operation.type reencode_videos \
--operation.rgb_encoder.vcodec h264 \
--operation.rgb_encoder.crf 23Поддержка глубины, от начала до конца
Подключите камеру Intel RealSense, установите use_depth: true, и LeRobot будет записывать карты глубины в полном цикле: захват в миллиметрах, сжатие в компактные 12-битные потоки видео глубины вместе с RGB-камерами и декодирование обратно в физические единицы во время обучения. Глубина отображается в реальном времени во время записи и в lerobot-dataset-viz. Поддерживаются роботы SO-100/101, Koch, OpenArm, reBot, Unitree G1 и другие.
Языковые аннотации в масштабе
Ваши наборы данных больше не ограничиваются одной строкой задачи на эпизод. LeRobot теперь нативно хранит богатые языковые аннотации: помеченные по времени подзадачи, планы, память, исправления, речь и пары VQA (вопрос-ответ) для каждой камеры. Новый CLI lerobot-annotate заполняет их автоматически с помощью VLM, которая наблюдает за вашими эпизодами:
lerobot-annotate \
--repo_id=${HF_USER}/my_dataset \
--new_repo_id=${HF_USER}/my_dataset_annotated \
--vlm.model_id=Qwen/Qwen2.5-VL-7B-Instruct \
--push_to_hub=trueСлой YAML-рецепта затем рендерит эти аннотации в сообщения в стиле чата во время выборки — именно такие данные понадобятся политикам роботов будущего для долгосрочных задач и общения. Масштабируйте это с помощью HF Jobs.
До 2x быстрее загрузка данных
Обучение на видео-наборах данных теперь работает примерно в 2 раза быстрее благодаря параллельному декодированию кадров с нескольких камер, компактной передаче uint8-кадров (в 4 раза меньше памяти между процессами) и постоянным рабочим потокам, сохраняющим кэш декодера между эпохами. Загрузка подмножества большого набора данных (через episodes=[...]) сократилась с минут до миллисекунд (275 с до 0.06 с в нашем тесте). Выборка теперь детерминирована и возобновляема, так что прерванные тренировки могут быть продолжены с того же места.

05Бенчмарки: один CLI для их всех
LeRobot v0.6.0 становится полноценным хабом для оценки VLA. Теперь доступно шесть новых симуляционных бенчмарков, запускаемых через единый CLI lerobot-eval, каждый с собственной страницей документации, Docker-образом и базовым чекпоинтом SmolVLA, протестированным в CI:
- LIBERO-plus: стресс-тест для VLA с примерно 10 000 возмущенных вариантов LIBERO по семи осям (освещение, углы камеры, переписанные инструкции). Показывает, когда политика ломается.
- RoboTwin 2.0: охватывает 50 задач биманулипляции на SAPIEN с сильной доменной рандомизацией, поставляется с более чем 100k готовых к обучению траекторий на Hub.
- RoboCasa365: 365 кухонных задач в 2500 процедурно сгенерированных кухнях на мобильном манипуляторе — самая большая поверхность задач в нашем наборе.
- RoboCerebra: оценка долгосрочного поведения с эпизодами, связывающими 3-6 подцелей под языковыми промежуточными инструкциями, плюс набор данных из 6660 эпизодов.
- RoboMME: экзамен на память: может ли политика считать повторения, отслеживать скрытые объекты и имитировать продемонстрированные процедуры? 16 задач в 4 наборах памяти.
- VLABench: тестирование знаний и рассуждений в манипуляции, от вопросов по физике до составных задач, таких как приготовление кофе от начала до конца.
Пример команды оценки:
lerobot-eval \
--policy.path=lerobot/smolvla_robotwin \
--env.type=robotwin \
--env.task=beat_block_hammer \
--eval.n_episodes=100 --eval.batch_size=1Вместе с LIBERO, Meta-World и NVIDIA IsaacLab-Arena это делает девять семейств бенчмарков под одной крышей. Оценка также стала быстрее: параллельная оценка теперь по умолчанию использует асинхронные векторизованные среды, что ускоряет процесс до 2 раз.
06Обучение и инференс
lerobot-rollout: развертывание получает свой CLI
Развертывание политики раньше было хаком поверх lerobot-record. Новый CLI lerobot-rollout делает развертывание самостоятельным рабочим процессом с подключаемыми стратегиями и бэкендами инференса (включая Real-Time Chunking для медленных совместимых VLA). Доступны стратегии:
- base: просто запускает политику.
- sentry: непрерывно записывает, вращая эпизоды и загружая их на Hub.
- highlight: сохраняет кольцевой буфер и сохраняет последние N секунд, когда вы нажимаете клавишу, чтобы интересный момент не был потерян.
- episodic: зеркалит классический рабочий процесс записи эпизодов/сброса.
- dagger: превращает развертывание в сбор данных.
Стратегия DAgger позволяет вам наблюдать за работой политики, нажимать клавишу (или использовать USB-педаль) в момент ошибки, брать управление на себя с помощью ведущего рычага для записи исправления и передавать управление обратно. Активные лидеры приводятся к позе ведомого перед тем, как вы возьмете управление, чтобы передача была плавной. Каждый кадр исправления помечается флагом intervention, и полученный набор данных готов для следующей тонкой настройки:
lerobot-rollout \
--strategy.type=dagger \
--policy.path=${HF_USER}/my_policy \
--robot.type=so100_follower \
--robot.port=/dev/ttyACM0 \
--teleop.type=so101_leader \
--teleop.port=/dev/ttyACM1 \
--dataset.repo_id=${HF_USER}/dagger_corrections \
--dataset.single_task="Grasp the block"Разверните, соберите исправления, тонко настройте, повторяйте: ротор обучения робота теперь — это флаг CLI.
FSDP: обучение моделей больше, чем ваша видеокарта
Роботизированные фундаментальные модели выходят за рамки возможностей одной видеокарты. Обучение LeRobot теперь поддерживает FSDP (Fully Sharded Data Parallel) через Accelerate: параметры, градиенты и состояние оптимизатора разбиваются по видеокартам, а чекпоинты собираются обратно в обычный однофайловый model.safetensors, который загружается как любая другая политика. Вы можете даже возобновить FSDP-запуск на другом количестве видеокарт.
Облачное обучение с HF Jobs
Нет видеокарты? Нет проблем. Та же самая команда lerobot-train теперь запускается в облаке с добавлением одного флага:
lerobot-train \
--dataset.repo_id=${HF_USER}/so101_test \
--policy.type=act \
--policy.repo_id=${HF_USER}/my_policy \
--job.target=a10g-smallLeRobot загружает ваш локальный набор данных в приватный репозиторий Hub (если необходимо), отправляет задание, транслирует логи в терминал и загружает обученную политику на Hub в конце. Выберите любую конфигурацию от T4 до 8x H200 с помощью --job.target (вычисление оплачивается по мере использования). Для пользователей из РФ важно отметить, что доступ к Hugging Face Jobs может быть ограничен, поэтому локальный запуск с FSDP или использование альтернативных облачных провайдеров может быть более надежным решением.
07Кодовая база: легче и чище
Команда pip install lerobot теперь действительно легковесна, с примерно на 40% меньшим количеством базовых зависимостей. Дополнительные функции (например, [training], [core_scripts], [evaluation]) покрывают остальное, а ошибки отсутствующих зависимостей точно указывают, какой дополнительный пакет нужно добавить. Больше не нужно устанавливать аппаратные зависимости, если вы используете LeRobot только для наборов данных. Поддерживаемый PyTorch перемещен в версию 2.7–2.11, с колесами CUDA 12.8, закрепленными по умолчанию для Linux. Установка через uv также поддерживается. Параметр --policy.dtype=bfloat16 теперь обеспечивает реальное смешанное точное обучение.
08Что это значит на практике
Выход LeRobot v0.6.0 знаменует собой переход от экспериментальных прототипов к промышленно-ориентированным инструментам для обучения роботов. Возможность «воображать» будущее через мир-модели позволяет роботам лучше справляться с неопределенностью и непредвиденными обстоятельствами. Единый API для моделей вознаграждения упрощает оценку качества данных и прогресса обучения, что ранее было узким местом. Улучшения в скорости загрузки данных и поддержке глубины делают работу с реальными сенсорами более плавной и эффективной.
Для исследователей и разработчиков это означает, что теперь можно быстрее итерировать модели, используя облачное обучение или локальные кластеры с FSDP. Стратегия DAgger в lerobot-rollout превращает ошибки в ценные данные для обучения, создавая замкнутый цикл улучшения. Поддержка множества новых моделей, от компактных EVO1 до мощных GR00T N1.7, обеспечивает гибкость выбора под конкретные задачи и доступные ресурсы.
В контексте российского рынка, где доступ к некоторым облачным сервисам может быть затруднен, локальный запуск с использованием FSDP и оптимизированных наборов данных становится особенно актуальным. LeRobot v0.6.0 предоставляет все необходимые инструменты для эффективного обучения и развертывания роботов как в облаке, так и на локальном оборудовании, делая передовые технологии робототехники более доступными.
LeRobot v0.6.0 — это мощный шаг вперед в democratization робототехники, предоставляя исследователям и инженерам инструменты для создания более умных, адаптивных и эффективных роботов. Начните с обновления библиотеки и попробуйте новые возможности уже сегодня.
Источник: Hugging Face ↗
