Проблема каскадных пайплайнов
Современные embodied-агенты (роботы, взаимодействующие с физическим миром) часто страдают от фрагментации: одни модели специализируются на визуальном языке, другие — на прогнозировании мира, третьи — на генерации действий. Каскадные конвейеры, где сначала синтезируются будущие наблюдения, а затем выводятся действия, создают узкие места на интерфейсах и накапливают ошибки предсказания.
Архитектура «Мозг и Мозжечок»
Решение iFLYTEK — iFLYTEK-Embodied-Omni — объединяет визуальные (видео/изображения), языковые и action-компоненты в единой рамке. Ключевая инновация — использование общего механизма multimodal self-attention для коммуникации между компонентами. Архитектура имитирует биологическое разделение:
- Высокоуровневый «мозг» (VLM + VGM): отвечает за понимание инструкций, планирование задач, отслеживание прогресса и прогнозирование визуального состояния среды.
- Низкоуровневый «мозжечок» (AGM): напрямую преобразует подцели и контекст в исполняемые чанки действий (action chunks), минуя промежуточные этапы.
Данные и обучение
Для обучения модели использован комплексный датасет, включающий:
- Видео с человеческими демонстрациями и взаимодействиями роботов.
- Данные с аннотациями действий (action-annotated) и без них (action-free).
- Данные для embodied reasoning, восприятия и общие image-text пары.
Применена стратегия из четырех этапов: прогрессивное обучение VLM, VGM и AGM с последующим совместным тонким настройкой (joint fine-tuning) всей модели.
Технические характеристики
| Компонент | Функция | Роль в архитектуре |
|---|---|---|
| VLM (Vision-Language Model) | Понимание инструкций и контекста | Часть «мозга» |
| VGM (Video Generation Model) | Прогнозирование будущего состояния | Часть «мозга» |
| AGM (Action Generation Model) | Генерация управляющих сигналов | «Мозжечок» |
| Shared Attention | Обмен контекстом между модулями | Единая основа |
Значение для индустрии
Работа iFLYTEK демонстрирует сдвиг от специализированных модулей к универсальным foundation-моделям для робототехники. Унификация позволяет избежать накопления ошибок в каскадных системах и открывает путь к созданию более надежных автономных агентов, способных действовать в сложных, динамичных средах.
Источник: arXiv cs.AI ↗
