Главная/Блог/Гайд/LingBot-VA 2.0: Революция в управлении…
Гайд4 мин чтения · 11 июля 2026 г.

LingBot-VA 2.0: Революция в управлении роботами от Ant Group

Ant Group представила LingBot-VA 2.0 — первую модель, обученную с нуля для физического взаимодействия, а не дообученную для генерации видео. Разбираем архитектуру, скорость и практическое применение.

LingBot-VA 2.0: Революция в управлении роботами от Ant Group

В мире робототехники и искусственного интеллекта существует давний разрыв между тем, как машины «видят» мир, и тем, как они действуют в нем. Большинство современных систем пытаются натянуть цифровые модели на физические задачи, что приводит к компромиссам в скорости и точности. Однако команда Robbyant, исследовательское подразделение Ant Group, предлагает принципиально иной подход. Они представили LingBot-VA 2.0 — первую в своем роде фундаментальную модель, нативно обученную для воплощенного интеллекта (embodied AI). Это не просто еще одна нейросеть для генерации видео; это архитектура, спроектированная с нуля для управления физическими объектами в реальном времени.

Почему это важно? Потому что традиционные подходы, использующие предобученные генераторы видео, сталкиваются с фундаментальными ограничениями: они слишком медленны для замкнутого цикла управления, их латентные представления не несут физической структуры, а их объективные функции не учат модель тому, как действия изменяют мир. LingBot-VA 2.0 устраняет эти разрывы, объединяя семантическое понимание, причинно-следственное прогнозирование и асинхронное выполнение в единую систему. В этой статье мы подробно разберем, как устроена эта модель, почему она работает быстрее и точнее предшественников, и что это значит для будущего робототехники.

01От генерации контента к физическому взаимодействию: почему старые подходы исчерпали себя

Чтобы понять инновационность LingBot-VA 2.0, нужно сначала взглянуть на то, как строились предыдущие поколения видео-действенных моделей. Большинство из них, включая первую версию LingBot-VA, опирались на два ключевых компонента, изначально созданных для цифрового контента: VAE (Variational Autoencoder), ориентированный на реконструкцию пикселей, и двустороннюю видео-диффузионную основу (bidirectional video-diffusion backbone) с прикрепленным модулем действий.

Такая архитектура порождает три критических ограничения. Во-первых, латентные представления, сохраняющие визуальное сходство, несут крайне мало информации о физической структуре объектов. Робот может «видеть» форму чашки, но не понимать, как она будет вести себя при падении. Во-вторых, итеративное удаление шума (denoising) над токенами видео требует слишком много вычислений для управления в реальном времени (closed-loop control). В-третьих, общие задачи генерации видео никогда не обучают модель тому, как конкретные действия изменяют состояние мира.

Четвертое несоответствие носит структурный характер. Двусторонние механизмы внимания (attention) обрабатывают информацию в обоих направлениях, тогда как физическое управление строго причинно-следственно (causal) и разворачивается только вперед во времени. Версия 1.0 LingBot-VA попыталась решить эту проблему путем дообучения (fine-tuning) стека в причинно-следственную модель. Версия 2.0 идет дальше: она обучает причинный DiT (Diffusion Transformer) с самого начала (pretrains from scratch), создавая архитектуру, которая изначально понимает время и действие как единое целое.

Интерфейс или визуализация работы модели LingBot-VA 2.0, демонстрирующая интеграцию видео и действий.
Интерфейс или визуализация работы модели LingBot-VA 2.0, демонстрирующая интеграцию видео и действий.

02Архитектурный прорыв: Семантический токенизатор и причинный DiT

Первый этап разработки LingBot-VA 2.0 — это замена стандартного VAE, который служил только для сжатия, на Семантический визуальный-действенный токенизатор (Semantic Visual-Action Tokenizer). Эта инновация, вдохновленная методом RepWAM, добавляет к задаче реконструкции две новые цели: семантическое выравнивание и извлечение латентных действий.

Семантическое выравнивание тянет визуальные латентные представления к учителю (frozen Perception Encoder), обеспечивая глубокое понимание сцены. Одновременно с этим, латентная цель действий извлекает компактные переменные перехода между последовательными латентными состояниями. Модель использует две дополнительные сети: инверсную динамику (inverse dynamics), которая предсказывает действие по изменению состояний, и прямую динамику (forward dynamics), которая декодирует это действие в карту транспорта и остаточные изменения.

LingBot-VA 2.0: Революция в управлении роботами от Ant Group

Результатом становится то, что состояния мира и действия теперь существуют в одном и том же латентном пространстве. Это позволяет использовать непомеченные видео из интернета для обучения, так как они несут скрытое обучение, релевантное для действий. Мир и действие больше не разделены; они едины.

На базе этого пространства строится вторая часть архитектуры — Причинный DiT с разреженным MoE (Mixture of Experts). Модель сохраняет структуру Mixture-of-Transformers, но разделяет потоки на эксперта по видео и эксперта по действиям, которые разделяют один механизм причинно-следственного внимания. У каждого эксперта есть свой собственный путь прямого распространения (feed-forward pathway).

Ключевая особенность здесь — асимметричное масштабирование. Эксперт по видео заменяет свой плотный FFN на разреженный слой MoE, который содержит 128 маршрутизируемых экспертов SwiGLU с топ-8 маршрутизацией и одним общим экспертом. Для балансировки нагрузки используется стратегия Loss-Free Balancing, не требующая вспомогательных потерь. Эксперт по действиям сохраняет плотный FFN с размерностью скрытого слоя 768.

В общей сложности видео-спинка содержит около 13,0 миллиардов параметров, из которых активны лишь 1,9 миллиарда. С учетом эксперта по действиям и голов MCP (Multi-Chunk Prediction), общее число параметров для обучения составляет около 15,3 миллиарда. Однако при выводе (inference) на каждый токен активируется всего около 2,5 миллиардов параметров. Обучение использует объектив rectified-flow и гибридный оптимизатор Muon + AdamW.

03Обучение без забвения: Многочастотное прогнозирование и совместное обучение

Архитектура — это только половина дела. Вторая половина — это то, чему модель учат. LingBot-VA 2.0 вводит два ключевых объектива, которые формируют способность модели к

Источник: MarkTechPost ↗