Робототехника стоит на пороге нового этапа развития, где границы между лабораторными экспериментами и реальным миром стираются. Долгое время основная проблема внедрения ИИ в физические устройства заключалась в том, что модели, демонстрирующие выдающиеся результаты в симуляции или контролируемой среде, часто терпели неудачу при столкновении с хаосом реального мира. Ant Group, известная своими прорывами в области искусственного интеллекта и финансовых технологий, представила решение этой проблемы — LingBot-VLA 2.0. Это не просто очередная итерация, а фундаментальная модель «зрение-язык-действие» (Vision-Language-Action, VLA), которая претендует на роль универсального мозга для роботов различных конфигураций.
В отличие от предыдущих версий, LingBot-VLA 2.0 фокусируется на трех ключевых аспектах: обобщении (generalization), расширенном пространстве действий и предиктивном моделировании динамики. Модель открытая, с лицензией Apache 2.0, она включает в себя технический отчет, код и чекпоинт на 6 миллиардов параметров. Это делает её доступной для исследователей и разработчиков по всему миру, включая Россию, где интерес к локальному запуску и адаптации таких моделей растет. В этой статье мы подробно разберем, как устроена эта система, откуда берутся данные, почему архитектура MoE важна для скорости и как модель справляется с задачами, которые ранее казались невозможными для единого политика.
01Что такое LingBot-VLA 2.0 и как она работает?
В основе LingBot-VLA 2.0 лежит концепция универсального робота-политика (generalist robot policy). Проще говоря, это единая нейросеть, которая принимает на вход визуальную информацию с камер и текстовую инструкцию, а на выходе генерирует команды для управления суставами и манипуляторами робота. Архитектурно модель построена на базе Qwen3-VL-4B-Instruct — мощного визуального языкового модели (VLM). Однако, чтобы превратить VLM в полноценного «робота», потребовалась глубокая адаптация.
Ключевой особенностью является использование двух моделей-учителей (teacher models) для дистилляции знаний: LingBot-Depth и DINO-Video. Первая отвечает за понимание глубины сцены, вторая — за понимание временной динамики. Это позволяет модели не просто «смотреть» на кадр, но и предвидеть, как объекты будут двигаться в будущем. Производительность впечатляет: один вызов инференса занимает около 130 миллисекунд на видеокарте NVIDIA GeForce RTX 4090D при использовании 10 шагов денормализации. Такая скорость критически важна для реального времени, где задержка даже в несколько сотен миллисекунд может привести к падению объекта или потере равновесия робота.
02Гигантский датасет: 60 000 часов данных
Качество модели напрямую зависит от качества данных. Команда Robbyant (исследовательское подразделение Ant Group) собрала беспрецедентный по объему датасет для обучения. Общий объем предварительно обученных данных составляет около 60 000 часов. Это не просто случайная выборка, а тщательно отфильтрованная коллекция, включающая 50 000 часов траекторий роботов и 10 000 часов эгоцентрических видео людей (видео от первого лица, снятых с камеры на голове или груди).
Что интересно, сырой пул данных был еще больше: около 90 000 часов роботизированных данных и 20 000 часов эгоцентрических видео. Однако «грязные» данные могли бы навредить обучению. Поэтому была разработана сложная система фильтрации. Она включает в себя вычисление третьей производной (jerk) по оси времени, а также Z-оценок для скорости и ускорения. Эпизоды с аномальной плавностью (что может указывать на отсутствие реального движения) или более чем 95% статичных сигналов отбрасывались.
Дополнительная проверка проводилась через URDF (Unified Robot Description Format) каждого робота. Аннотаторы и алгоритмы удаляли размытые кадры, окклюзии (перекрытия объектов), пропущенные кадры и ошибки синхронизации между камерами. Эгоцентрические видео проходили дополнительную проверку через VLM-фильтр, а также реконструкцию позы рук с помощью MANO и SLAM-систем. Такой строгий отбор позволил создать высококачественную базу, на которой модель научилась понимать нюансы человеческих и роботизированных движений.
03Унификация действий: 55-мерный канонический вектор
Одна из самых больших проблем в робототехнике — разнородность платформ. Робот с одним манипулятором, двурукий робот, гуманоид с мобильной базой и робот с ловкой рукой имеют совершенно разные наборы суставов и кинематику. LingBot-VLA 2.0 решает эту проблему через унификацию. Модель использует 55-мерный канонический вектор для представления как состояний, так и действий.

Этот вектор имеет фиксированную структуру, которая одинакова для всех роботов в датасете. Если у конкретного робота отсутствует какой-либо компонент (например, нет талии или головы), соответствующие измерения просто заполняются нулями (padding). Структура вектора выглядит следующим образом:
- Позиция суставов руки: 14 измерений.
- Поза концевого эффектора: 14 измерений (XYZ координаты + кватернион вращения, по 7 на каждую руку).
- Позиция захвата (gripper): 1 измерение.
- Позиция суставов кисти: 12 измерений (для ловких рук).
- Позиция талии: 1 измерение.
- Позиция головы: 1 измерение.
- Сигнал мобильности: 1 измерение.
- Зарезервировано: остальные измерения.
Такой подход позволяет одной модели управлять всем телом робота, от мобильных баз до сложных манипуляторов. Это снижает необходимость в переобучении модели под каждую новую платформу с нуля, что значительно ускоряет внедрение.
04Архитектура MoE: Эффективность через разреженность
В блоке эксперта действий (action expert) команда отказалась от стандартных полносвязных сетей в пользу архитектуры Mixture-of-Experts (MoE). Это позволяет модели масштабироваться, не увеличивая вычислительные затраты на каждый шаг инференса. В каждой слое MoE есть один общий эксперт (shared expert) и несколько маршрутизируемых экспертов (routed experts).
Для каждого токена активируются только топ-K маршрутизируемых экспертов. Это означает, что активные вычисления остаются ограниченными, даже если общее количество параметров в модели огромно. Каждый эксперт представляет собой MLP с активацией SwiGLU и меньшей промежуточной шириной. Маршрутизация следует стратегии, вдохновленной DeepSeek-V3, и использует сигмоидную функцию без вспомогательных потерь (auxiliary-loss-free). Это упрощает обучение и стабилизирует процесс.
Для коррекции дисбаланса нагрузки между экспертами используется смещение (bias) на уровне каждого эксперта, что позволяет избежать необходимости вводить дополнительные функции потерь для балансировки. Результаты показывают, что при сопоставимом количестве активных параметров модель MoE достигает меньшей ошибки обучения и валидации по сравнению с плотными (dense) моделями. Это критически важно для развертывания на ресурсоемких, но ограниченных по мощности устройствах.
05Предиктивное моделирование: Двойной запрос
Реальное выполнение задач требует не просто реакции на текущий кадр, но и предвидения. LingBot-VLA 2.0 внедряет два обучаемых запроса (queries) к визуальным и текстовым токенам: Qt для текущих наблюдений и Qt+T для будущих наблюдений. Горизонт T равен размеру чанка действий. Это позволяет модели «заглядывать в будущее» на несколько шагов вперед.

Эти запросы контролируются двумя учителями:
- LingBot-Depth: Предоставляет явные геометрические подсказки через предсказание глубины. Это помогает роботу понимать пространственные отношения между объектами.
- DINO-Video: Предоставляет семантические приоритеты, основанные на временной динамике. DINO-Video построен на базе DINOv3 с блочным причинно-следственным временным вниманием и 3D-RoPE. Он обучен на 5 миллионах видеоклипов, охватывающих интернет-данные, эгоцентрические видео и роботизированные данные. На бенчмарке LARYBench DINO-Video лидирует по трем из четырех метрик.
Такой дуальный подход позволяет модели не только видеть, где находится объект сейчас, но и понимать, как он будет двигаться, что критически важно для задач, требующих точного планирования траектории.
06Результаты бенчмарков: GM-100 и мобильная манипуляция
Оценка модели проводилась на бенчмарке GM-100 (Great March 100), который включает двуручные задачи. Модель обучалась совместно на девяти задачах для каждой конфигурации. Результаты представлены в формате «прогресс / успех».
На платформе AgileX Cobot Magic LingBot-VLA 2.0 показала результат 66.2 / 34.4, что превосходит π0.5 (59.1 / 32.2) и предыдущую версию LingBot-VLA 1.0 (58.2 / 30.0). На Galaxea R1Pro результат составил 34.6 / 15.6, также превосходя аналоги.
Особое внимание стоит уделить задачам мобильной манипуляции с длинным горизонтом. В условиях in-domain (в распределении обучения) модель на Astribot S1 для сортировки продуктов в холодильнике показала 77.1 / 60.0, в то время как π0.5 — 65.3 / 46.7. В условиях OOD (out-of-distribution, с изменением позы и объектов) LingBot-VLA 2.0 также сохранила преимущество: 37.0 / 13.3 против 30.3 / 6.7 у π0.5. На задаче очистки плиты с помощью Cobot Magic-ARX X5 модель достигла 84.3 / 66.7 в in-domain и 67.5 / 40.0 в OOD, превосходя π0.5.
Значительный прогресс наблюдается в задачах, требующих точного позиционирования объектов. Например, на задаче AgileX Retrieve keychain успех вырос с 60.0% в версии 1.0 до 100.0% в версии 2.0. Однако разрыв между прогрессом и успехом в некоторых задачах указывает на то, что финальные шаги точного размещения или отпускания объекта остаются сложными для модели.

07Практическое применение и развертывание
Расширенное пространство действий открывает путь к реальным сценариям использования. Вот несколько примеров:
- Мобильная манипуляция на кухне: Робот Astribot S1 сортирует фрукты и напитки в холодильник. Это требует координации движения базы, открытия двери и размещения объектов.
- Очистка поверхностей: Cobot Magic-ARX X5 протирает плиту губкой, объединяя захват, протирание и перемещение инструмента.
- Двуручная упаковка: Задачи GM-100, такие как упаковка яиц или инструментов, требуют слаженной работы двух манипуляторов.
- Управление ловкими руками: Роботы Unitree G1, Fourier GR-2 и AgiBot A2 используют 12-осевые кисти, а не простые захваты, что демонстрирует способность модели работать с высокоточными манипуляторами.
Для разработчиков доступен репозиторий с скриптами установки, загрузки и развертывания. Пример загрузки весов:
# Environment: Python 3.12, PyTorch 2.8.0, flash-attn 2.8.3
python3 scripts/download_hf_model.py --repo_id robbyant/lingbot_vla_v2 --local_dir lingbot_vlaДля развертывания на реальном роботе используется сервер политик с компилированным инференсом. Пример запуска:
export QWEN3VL_PATH=path_to_Qwen3_VL_Instruct
python -m deploy.lingbot_vla_v2_policy \
--model_path path_to_posttraining_ckpt \
--use_compile \
--use_length 25 \
--port portМодель поддерживает пост-обучение на датасетах LeRobot v2.1 или v3.0. Пример дообучения на RoboTwin 2.0 по 50 задачам доступен в документации. Оптимизатор по умолчанию — AdamW, но также доступен Muon optimizer.
08Что это значит на практике
Выход LingBot-VLA 2.0 знаменует собой сдвиг парадигмы в робототехнике. Раньше каждый новый тип робота требовал обучения новой модели с нуля, что было дорого и долго. Теперь, благодаря унифицированному 55-мерному пространству действий и огромному датасету, одна модель может быть адаптирована под множество платформ. Это снижает барьер для входа в робототехнику для стартапов и исследовательских групп.
Для России, где развитие собственного ИИ и робототехники является стратегическим приоритетом, открытость модели (Apache 2.0) и возможность локального запуска на доступном оборудовании (RTX 4090D) делают LingBot-VLA 2.0 ценным инструментом. Исследователи могут использовать её как базу для своих экспериментов, дообучать на отечественных датасетах и интегрировать в локальные роботизированные комплексы. Предиктивное моделирование и архитектура MoE обеспечивают баланс между точностью и скоростью, что критически важно для промышленных применений.
Однако, как и любая передовая технология, LingBot-VLA 2.0 не лишена недостатков. Разрыв между прогрессом и успехом в финальных этапах манипуляции указывает на то, что задача точного контроля остается сложной. Кроме того, требования к вычислительным ресурсам для инференса могут быть высокими для мобильных роботов. Тем не менее, это значительный шаг вперед. Команда Ant Group продемонстрировала, что масштаб данных, правильная архитектура и внимание к деталям фильтрации могут решить проблему «разрыва между лабораторией и реальностью».
В будущем мы можем ожидать появления более легких версий модели, оптимизированных для встраиваемых систем, а также расширение поддержки новых типов манипуляторов. LingBot-VLA 2.0 — это не конечная точка, а мощный фундамент для следующего поколения универсальных роботов.
Источник: MarkTechPost ↗
