Релиз модели11 июля 2026 г., 11:17 МСК🤖 Auto

Robbyant представил LingBot-VA 2.0: причинно-следственная модель для Physical AI

Ant Group выпустила первую embodied-модель, обученную с нуля для управления роботами. LingBot-VA 2.0 достигает 225 Гц управления и превосходит аналоги в симуляции.

Баннер новости 3372

Архитектурный сдвиг: от генерации к причинности

Команда Robbyant (подразделение Ant Group) представила LingBot-VA 2.0 — фундаментальную модель для физического ИИ (Physical AI). В отличие от предыдущих подходов, где видео-генераторы дообучались под задачи роботов, новая архитектура pretrains causal DiT (Diffusion Transformer) с нуля. Это решает три ключевые проблемы старых моделей: медленная итеративная денормализация, отсутствие физической структуры в латентных пространствах и несовместимость двунаправленного внимания с причинно-следственным управлением.

Технические детали: Sparse MoE и семантический токенизатор

Модель использует уникальный семантический токенизатор, заменяющий стандартный VAE. Он объединяет визуальные латенты и действия в единое пространство, позволяя использовать непомеченные видео из интернета для обучения. Архитектура включает:

  • Видео-эксперт: 13.0B параметров (1.9B активных), использующий Sparse MoE с 128 экспертами (top-8 routing) и стратегией Loss-Free Balancing.
  • Эксперт действий: Плотный FFN с размерностью скрытого слоя 768.
  • Общее число параметров: ~15.3B, из которых в инференсе активно ~2.5B на токен.

Результаты бенчмарков: лидерство в RoboTwin 2.0

На наборе данных RoboTwin 2.0 (50 задач, 27.5k демонстраций) LingBot-VA 2.0 демонстрирует лучшие результаты среди существующих VLA-моделей. Ниже приведено сравнение успешности выполнения задач (Success Rate) в чистых и рандомизированных условиях:

Метод Clean (%) Randomized (%) Avg. (%)
X-VLA 72.9 72.8 72.9
π0.5 82.7 76.8 79.8
Motus 88.7 87.0 87.9
LingBot-VA (v1) 92.9 91.6 92.2
LingBot-VA 2.0 93.8 93.4 93.6

Скорость инференса: 225 Гц благодаря оптимизациям

Ключевое преимущество версии 2.0 — асинхронное выполнение. Модель использует Foresight Reasoning: пока робот выполняет действие, видео-эксперт предсказывает следующий кадр, а эксперт действий декодирует следующее действие. Реальные наблюдения перезаписывают предсказания, устраняя дрейф. Оптимизации (дистилляция, FP8 TensorRT, пaged KV cache) позволили достичь частоты управления 225 Hz (время на чанк — 142 мс), что в 6.5 раз быстрее базовой реализации.

Практическое применение

Модель поддерживает few-shot обучение (адаптация за 10–15 демонстраций), ин-контекстное обучение через видео-демонстрации (ICL) и реактивный контроль динамических объектов (например, хоккей или конвейер). Обучение проводилось на корпусе из 65.4k эпизодов с ретаргетингом поз рук человека в действия робота.

Бенчмарки

БенчмаркLingBot-VAMotusX-VLAπ0.5
RoboTwin 2.0 Avg92.2%87.9%72.9%79.8%

Жирным — лучший результат в строке. Источник цифр — официальная публикация.

Источник: MarkTechPost ↗