Прорыв в embodied AI: физика вместо пикселей
Команда разработчиков представила LingBot-Video — специализированный видеогенератор, созданный не для развлечения, а для воплощенного интеллекта (embodied AI). В отличие от общих моделей, LingBot-Video спроектирован так, чтобы понимать физические свойства мира: он корректно воспроизводит свойства материалов, освещение, отражения и реалистичные движения объектов.
Ключевая задача — помощь роботам. Генератор создает синтетические видео для обучения нейросетей и тестирования алгоритмов управления, что критически важно, так как сбор реальных данных для роботов (особенно гуманоидов и четвероногих платформ) дорог и долог.
Архитектура и производительность
Модель поддерживает три режима работы: текстовая генерация (t2v), генерация по изображению (i2v) и комбинированная (ti2v). Архитектура построена на базе Mixture of Experts (MoE), что позволяет балансировать между скоростью и качеством.
Система демонстрирует лидерство в бенчмарке RBench Leaderboard по всем ключевым показателям, превосходя существующие аналоги в задачах прогнозирования траекторий движения и симуляции поведения роботов в открытом мире.
Технические характеристики моделей
Разработчики выпустили две версии модели, адаптированные под разные вычислительные мощности:
| Параметр | LingBot-Video Dense | LingBot-Video MoE |
|---|---|---|
| Размер модели | 1.3B (параметров) | 30B (активных: 3B) |
| Архитектура | Dense | Mixture of Experts (MoE) |
| Назначение | Компактное решение, быстрая инференция | Высокое качество, сложная симуляция физики |
| Лидерборд | — | Лидер RBench (все метрики) |
Практическое применение
Генератор способен моделировать широкий спектр агентов: от мобильных платформ до сложных гуманоидов. Это позволяет инженерам тестировать алгоритмы навигации и манипуляции в виртуальной среде, которая визуально и физически неотличима от реальности. Открытый доступ к коду (GitHub) и модели (Hugging Face) ускоряет внедрение технологии в исследовательские проекты.
Источник: Robbyant ↗
