Архитектурный сдвиг: от генерации к причинности
Команда Robbyant (подразделение Ant Group) представила LingBot-VA 2.0 — фундаментальную модель для физического ИИ (Physical AI). В отличие от предыдущих подходов, где видео-генераторы дообучались под задачи роботов, новая архитектура pretrains causal DiT (Diffusion Transformer) с нуля. Это решает три ключевые проблемы старых моделей: медленная итеративная денормализация, отсутствие физической структуры в латентных пространствах и несовместимость двунаправленного внимания с причинно-следственным управлением.
Технические детали: Sparse MoE и семантический токенизатор
Модель использует уникальный семантический токенизатор, заменяющий стандартный VAE. Он объединяет визуальные латенты и действия в единое пространство, позволяя использовать непомеченные видео из интернета для обучения. Архитектура включает:
- Видео-эксперт: 13.0B параметров (1.9B активных), использующий Sparse MoE с 128 экспертами (top-8 routing) и стратегией Loss-Free Balancing.
- Эксперт действий: Плотный FFN с размерностью скрытого слоя 768.
- Общее число параметров: ~15.3B, из которых в инференсе активно ~2.5B на токен.
Результаты бенчмарков: лидерство в RoboTwin 2.0
На наборе данных RoboTwin 2.0 (50 задач, 27.5k демонстраций) LingBot-VA 2.0 демонстрирует лучшие результаты среди существующих VLA-моделей. Ниже приведено сравнение успешности выполнения задач (Success Rate) в чистых и рандомизированных условиях:
| Метод | Clean (%) | Randomized (%) | Avg. (%) |
|---|---|---|---|
| X-VLA | 72.9 | 72.8 | 72.9 |
| π0.5 | 82.7 | 76.8 | 79.8 |
| Motus | 88.7 | 87.0 | 87.9 |
| LingBot-VA (v1) | 92.9 | 91.6 | 92.2 |
| LingBot-VA 2.0 | 93.8 | 93.4 | 93.6 |
Скорость инференса: 225 Гц благодаря оптимизациям
Ключевое преимущество версии 2.0 — асинхронное выполнение. Модель использует Foresight Reasoning: пока робот выполняет действие, видео-эксперт предсказывает следующий кадр, а эксперт действий декодирует следующее действие. Реальные наблюдения перезаписывают предсказания, устраняя дрейф. Оптимизации (дистилляция, FP8 TensorRT, пaged KV cache) позволили достичь частоты управления 225 Hz (время на чанк — 142 мс), что в 6.5 раз быстрее базовой реализации.
Практическое применение
Модель поддерживает few-shot обучение (адаптация за 10–15 демонстраций), ин-контекстное обучение через видео-демонстрации (ICL) и реактивный контроль динамических объектов (например, хоккей или конвейер). Обучение проводилось на корпусе из 65.4k эпизодов с ретаргетингом поз рук человека в действия робота.
Бенчмарки
| Бенчмарк | LingBot-VA | Motus | X-VLA | π0.5 |
|---|---|---|---|---|
| RoboTwin 2.0 Avg | 92.2% | 87.9% | 72.9% | 79.8% |
Жирным — лучший результат в строке. Источник цифр — официальная публикация.
Источник: MarkTechPost ↗
