World-модели: роботы, которые «предвидят» будущее
Ключевое изменение v0.6.0 — внедрение политик, основанных на world-моделях. Теперь агенты могут прогнозировать будущие кадры в латентном пространстве, что улучшает принятие решений. В релиз вошли три новые архитектуры:
- VLA-JEPA: Компактная модель на базе Qwen3-VL-2B. Во время обучения JEPA-модель предсказывает будущие кадры, но исчезает на этапе инференса, обеспечивая обучение без накладных расходов.
- LingBot-VA: Авторегрессионная модель, предсказывающая видео и действия чанками. Работает на GPU 24–32 ГБ. Поддерживает сохранение предсказанного видео для сравнения с реальностью.
- FastWAM: Модель ~5B параметров, объединяющая эксперта по видео и эксперта по действиям. На инференсе пропускает этап «мечтания» (dreaming), сразу генерируя действия.
Зоопарк VLA: от GR00T N1.7 до легковесного EVO1
Библиотека моделей расширена. NVIDIA GR00T N1.5 заменен на GR00T N1.7 с VLM Cosmos-Reason2-2B. Также добавлены MolmoAct2 (Allen AI), EO-1, Multitask DiT и EVO1. EVO1 выделяется малым весом (0.77B параметров) и поддержкой Real-Time Chunking.
| Модель | Базовая архитектура | Параметры | Ключевая особенность |
|---|---|---|---|
| GR00T N1.7 | Cosmos-Reason2-2B (Qwen3-VL) | ~2B | Кросс-эмбодимент, совместимость с Isaac |
| MolmoAct2 | Molmo | ~12 GB VRAM (bf16) | Zero-shot на SO-100/101, LoRA-файн-тюнинг |
| EO-1 | Qwen2.5-VL-3B | ~3B | Предобучка на interleaved vision-text-action |
| Multitask DiT | Diffusion Transformer | ~450M | Управление через естественный язык, CLIP-условия |
| EVO1 | InternVL3-1B | 0.77B | Работа на слабых GPU, Real-Time Chunking |
API Reward-моделей: оценка успеха без дообучения
Появился унифицированный API lerobot.rewards для оценки прогресса робота. Два новых инструмента работают zero-shot:
- Robometer: Модель на базе Qwen3-VL-4B, обученная на 1M+ траекториях. Оценивает прогресс по видео и текстовой инструкции без дообучения под конкретную задачу.
- TOPReward: Использует лог-вероятность токена «True» от любой VLM (например, Qwen3-VL) для бинарной оценки успеха.
Инфраструктура: FSDP, облачный тренинг и скорость
LeRobot v0.6.0 оптимизирован для масштабирования. Добавлена поддержка FSDP (Fully Sharded Data Parallel) для обучения моделей, превышающих объем памяти одного GPU. Появилась интеграция с HF Jobs для облачного обучения. Загрузка датасетов ускорена до 2x благодаря новым опциям кодирования видео (поддержка NVENC, VAAPI) и автоматической языковой аннотации.
Источник: Hugging Face blog ↗
