Релиз модели6 июля 2026 г., 14:15 МСК🤖 Auto

LeRobot v0.6.0: World-модели, новые VLA и облачный тренинг

Hugging Face выпустил LeRobot 0.6.0 с поддержкой world-model политик (VLA-JEPA, FastWAM), интеграцией GR00T N1.7, MolmoAct2 и API для reward-моделей Robometer.

Баннер новости 2952

World-модели: роботы, которые «предвидят» будущее

Ключевое изменение v0.6.0 — внедрение политик, основанных на world-моделях. Теперь агенты могут прогнозировать будущие кадры в латентном пространстве, что улучшает принятие решений. В релиз вошли три новые архитектуры:

  • VLA-JEPA: Компактная модель на базе Qwen3-VL-2B. Во время обучения JEPA-модель предсказывает будущие кадры, но исчезает на этапе инференса, обеспечивая обучение без накладных расходов.
  • LingBot-VA: Авторегрессионная модель, предсказывающая видео и действия чанками. Работает на GPU 24–32 ГБ. Поддерживает сохранение предсказанного видео для сравнения с реальностью.
  • FastWAM: Модель ~5B параметров, объединяющая эксперта по видео и эксперта по действиям. На инференсе пропускает этап «мечтания» (dreaming), сразу генерируя действия.

Зоопарк VLA: от GR00T N1.7 до легковесного EVO1

Библиотека моделей расширена. NVIDIA GR00T N1.5 заменен на GR00T N1.7 с VLM Cosmos-Reason2-2B. Также добавлены MolmoAct2 (Allen AI), EO-1, Multitask DiT и EVO1. EVO1 выделяется малым весом (0.77B параметров) и поддержкой Real-Time Chunking.

Модель Базовая архитектура Параметры Ключевая особенность
GR00T N1.7 Cosmos-Reason2-2B (Qwen3-VL) ~2B Кросс-эмбодимент, совместимость с Isaac
MolmoAct2 Molmo ~12 GB VRAM (bf16) Zero-shot на SO-100/101, LoRA-файн-тюнинг
EO-1 Qwen2.5-VL-3B ~3B Предобучка на interleaved vision-text-action
Multitask DiT Diffusion Transformer ~450M Управление через естественный язык, CLIP-условия
EVO1 InternVL3-1B 0.77B Работа на слабых GPU, Real-Time Chunking

API Reward-моделей: оценка успеха без дообучения

Появился унифицированный API lerobot.rewards для оценки прогресса робота. Два новых инструмента работают zero-shot:

  • Robometer: Модель на базе Qwen3-VL-4B, обученная на 1M+ траекториях. Оценивает прогресс по видео и текстовой инструкции без дообучения под конкретную задачу.
  • TOPReward: Использует лог-вероятность токена «True» от любой VLM (например, Qwen3-VL) для бинарной оценки успеха.

Инфраструктура: FSDP, облачный тренинг и скорость

LeRobot v0.6.0 оптимизирован для масштабирования. Добавлена поддержка FSDP (Fully Sharded Data Parallel) для обучения моделей, превышающих объем памяти одного GPU. Появилась интеграция с HF Jobs для облачного обучения. Загрузка датасетов ускорена до 2x благодаря новым опциям кодирования видео (поддержка NVENC, VAAPI) и автоматической языковой аннотации.

Источник: Hugging Face blog ↗