Суть релиза: от лаборатории к реальным роботам
Команда Robbyant (Ant Group) выпустила LingBot-VLA 2.0 — фундаментальную модель «зрение-язык-действие» (VLA) с 6 миллиардами параметров. В отличие от многих академических прототипов, эта модель ориентирована на кросс-эмбадмент (cross-embodiment), то есть способность одного веса управлять совершенно разными роботами: от манипуляторов до гуманоидов. Релиз включает технический отчет, код под лицензией Apache-2.0 и чекпоинт lingbot-vla-v2-6b.
Архитектура и производительность
Модель построена на базе Qwen3-VL-4B-Instruct в качестве визуального языка. Для ускорения инференса используется архитектура Mixture-of-Experts (MoE) в эксперте действий. Ключевая метрика: один вызов инференса занимает около 130 мс на NVIDIA GeForce RTX 4090D (при 10 шагах денормализации). Это позволяет использовать модель в реальном времени для сложных задач манипуляции.
Данные и фильтрация: 60 000 часов обучения
Качество модели обеспечивается огромным датасетом. Команда отфильтровала сырые данные (90 000 часов робот-траекторий и 20 000 часов эгоцентричных видео) до 60 000 часов высококачественных данных. Использовалась строгая фильтрация по Z-оценкам ускорения и Jerk (третьей производной), а также удаление кадров с размытием и окклюзиями. Аннотация задач автоматизирована через VLM Qwen3.6-27B, которая разбивает видео на 18 атомарных действий.
Универсальный язык действий
Главное нововведение — унификация пространства действий. Разные роботы имеют разное количество степеней свободы, поэтому LingBot-VLA 2.0 использует 55-мерный канонический вектор. Это позволяет модели контролировать руки, кисти, захваты, талию, голову и мобильные базы одновременно. Даже если у робота нет какой-то части (например, головы), соответствующие измерения просто заполняются нулями (padding).
| Компонент | Размерность | Примечание |
|---|---|---|
| Позиция суставов руки | 14 | Положение сочленений манипулятора |
| Поза конечного эффектора | 14 | XYZ + кватернион вращения (7x2) |
| Позиция захвата (Gripper) | 12 | Для простых захватов |
| Позиция суставов кисти | 12 | Для ловких рук (dexterous hands) |
| Позиция талии | — | Padding, если нет |
| Позиция головы | — | Padding, если нет |
| Сигнал мобильности | — | Для баз с колесами/ногами |
Результаты бенчмарков
Модель протестирована на бимануальном бенчмарке GM-100 и задачах мобильной манипуляции. LingBot-VLA 2.0 демонстрирует значительный прирост по сравнению с версией 1.0 и конкурентами (π0.5, GR00T N1.7), особенно в задачах, требующих точного позиционирования объектов.
| Платформа | Задача | Настройка | LingBot-VLA 2.0 | π0.5 |
|---|---|---|---|---|
| Astribot S1 | Сортировка в холодильнике | In-domain | 77.1 / 60.0 | 65.3 / 46.7 |
| Astribot S1 | Сортировка в холодильнике | OOD (сдвиг) | 37.0 / 13.3 | 30.3 / 6.7 |
| Cobot Magic-ARX X5 | Очистка плиты | In-domain | 84.3 / 66.7 | 79.9 / 60.0 |
| Cobot Magic-ARX X5 | Очистка плиты | OOD (сдвиг) | 67.5 / 40.0 | 62.5 / 33.3 |
Особый успех отмечен на задаче AgileX Retrieve keychain, где успех вырос с 60.0% (v1.0) до 100.0%. Однако разрыв между прогрессом и успехом в некоторых задачах указывает на сложности с финальным точным размещением объектов.
Как запустить
Модель доступна через Hugging Face. Для работы требуется Python 3.12, PyTorch 2.8.0 и flash-attn 2.8.3. Поддерживается дообучение (fine-tuning) на датасетах LeRobot v2.1/v3.0 и RoboTwin 2.0. Оптимизатор по умолчанию — AdamW, но доступна конфигурация с Muon optimizer.
Источник: MarkTechPost ↗
