Релиз модели9 июля 2026 г., 03:16 МСК🤖 Auto

Robbyant выпустила LingBot-VLA 2.0: 6B-модель для универсального управления роботами

Ant Group представила open-source VLA-модель на базе Qwen3-VL, способную управлять разными роботами через единый 55-мерный вектор действий с задержкой 130 мс.

Баннер новости 3161

Суть релиза: от лаборатории к реальным роботам

Команда Robbyant (Ant Group) выпустила LingBot-VLA 2.0 — фундаментальную модель «зрение-язык-действие» (VLA) с 6 миллиардами параметров. В отличие от многих академических прототипов, эта модель ориентирована на кросс-эмбадмент (cross-embodiment), то есть способность одного веса управлять совершенно разными роботами: от манипуляторов до гуманоидов. Релиз включает технический отчет, код под лицензией Apache-2.0 и чекпоинт lingbot-vla-v2-6b.

Архитектура и производительность

Модель построена на базе Qwen3-VL-4B-Instruct в качестве визуального языка. Для ускорения инференса используется архитектура Mixture-of-Experts (MoE) в эксперте действий. Ключевая метрика: один вызов инференса занимает около 130 мс на NVIDIA GeForce RTX 4090D (при 10 шагах денормализации). Это позволяет использовать модель в реальном времени для сложных задач манипуляции.

Данные и фильтрация: 60 000 часов обучения

Качество модели обеспечивается огромным датасетом. Команда отфильтровала сырые данные (90 000 часов робот-траекторий и 20 000 часов эгоцентричных видео) до 60 000 часов высококачественных данных. Использовалась строгая фильтрация по Z-оценкам ускорения и Jerk (третьей производной), а также удаление кадров с размытием и окклюзиями. Аннотация задач автоматизирована через VLM Qwen3.6-27B, которая разбивает видео на 18 атомарных действий.

Универсальный язык действий

Главное нововведение — унификация пространства действий. Разные роботы имеют разное количество степеней свободы, поэтому LingBot-VLA 2.0 использует 55-мерный канонический вектор. Это позволяет модели контролировать руки, кисти, захваты, талию, голову и мобильные базы одновременно. Даже если у робота нет какой-то части (например, головы), соответствующие измерения просто заполняются нулями (padding).

Компонент Размерность Примечание
Позиция суставов руки 14 Положение сочленений манипулятора
Поза конечного эффектора 14 XYZ + кватернион вращения (7x2)
Позиция захвата (Gripper) 12 Для простых захватов
Позиция суставов кисти 12 Для ловких рук (dexterous hands)
Позиция талии Padding, если нет
Позиция головы Padding, если нет
Сигнал мобильности Для баз с колесами/ногами

Результаты бенчмарков

Модель протестирована на бимануальном бенчмарке GM-100 и задачах мобильной манипуляции. LingBot-VLA 2.0 демонстрирует значительный прирост по сравнению с версией 1.0 и конкурентами (π0.5, GR00T N1.7), особенно в задачах, требующих точного позиционирования объектов.

Платформа Задача Настройка LingBot-VLA 2.0 π0.5
Astribot S1 Сортировка в холодильнике In-domain 77.1 / 60.0 65.3 / 46.7
Astribot S1 Сортировка в холодильнике OOD (сдвиг) 37.0 / 13.3 30.3 / 6.7
Cobot Magic-ARX X5 Очистка плиты In-domain 84.3 / 66.7 79.9 / 60.0
Cobot Magic-ARX X5 Очистка плиты OOD (сдвиг) 67.5 / 40.0 62.5 / 33.3

Особый успех отмечен на задаче AgileX Retrieve keychain, где успех вырос с 60.0% (v1.0) до 100.0%. Однако разрыв между прогрессом и успехом в некоторых задачах указывает на сложности с финальным точным размещением объектов.

Как запустить

Модель доступна через Hugging Face. Для работы требуется Python 3.12, PyTorch 2.8.0 и flash-attn 2.8.3. Поддерживается дообучение (fine-tuning) на датасетах LeRobot v2.1/v3.0 и RoboTwin 2.0. Оптимизатор по умолчанию — AdamW, но доступна конфигурация с Muon optimizer.

Источник: MarkTechPost ↗