Архитектура: Мир + Поток событий
Главное нововведение Wan-Streamer v0.3 — отказ от монолитного подхода к генерации видео. Модель теперь разделяет контент на две независимые части:
- World (Мир): Статичные элементы, требующие долгосрочной согласованности. Сюда входят фон, внешность персонажа, освещение и фоновые звуки. Эта часть загружается один раз.
- Event Stream (Поток событий): Динамические изменения во времени. Речь, мимика, жесты, движение камеры и взаимодействие с объектами. Эти элементы генерируются пошагово, синхронно с входными данными пользователя.
Такой подход позволяет использовать обычные видео для обучения: модель сначала «понимает» сцену, а затем учится предсказывать, что произойдет дальше. Это открывает путь к применению не только в чатах, но и в навигации роботов (embodied navigation) и симуляциях.Свободные действия (Free-form Behavior)
В отличие от версий 0.1 и 0.2, где аватары лишь говорили и кивали, v0.3 поддерживает свободные действия, описанные естественным языком. Модель может выполнять сложные физические манипуляции, такие как взятие предметов, повороты или изменение позы, интегрируя их в речь без предварительной хореографии.
Пример работы модели:
- (reaches into the grass and picks up a green leaf) — «(тянется в траву и берет зеленый лист)»
- Look what I found. — «Посмотри, что я нашел.»
- (covers mouth in surprise) — «(закрывает рот от удивления)»
Действия и речь генерируются в едином потоке, что обеспечивает естественную тайминговую синхронизацию.Технические характеристики и сравнение версий
Wan-Streamer v0.3 сохраняет высокую скорость инференса, характерную для предыдущих релизов, но значительно расширяет функционал. Модель работает в режиме full-duplex (полнодуплексная связь), обрабатывая ввод с камеры, микрофона и текста пользователя, генерируя ответное видео и аудио с задержкой, приемлемой для живого диалога.
| Параметр | Wan-Streamer v0.1 | Wan-Streamer v0.2 | Wan-Streamer v0.3 |
|---|---|---|---|
| Основной фокус | Энд-ту-энд аудио/видео | Повышенное разрешение | Обучение на видео + свободные действия |
| Поведение агента | Речь + слушание | Речь + слушание (высокая точность) | Речь + свободные действия (жесты, манипуляции) |
| Разрешение видео | 192×336 @ 25 fps | 640×368 @ 25 fps | 640×368 @ 25 fps |
| Задержка (Latency) | ~200 мс (модель) / ~550 мс (общая) | ~200 мс (модель) / ~550 мс (общая) | ~200 мс (модель) / ~550 мс (общая) |
| Архитектура | Thinker + 1 GPU Performer | Thinker + параллельный Performer | Thinker + параллельный Performer |
Демонстрации и применение
В релизе представлены два типа демо:
- Реальные диалоги: Полнодуплексные сессии с немецким инженером в мастерской и итальянским шеф-поваром на кухне. Задержка включает сетевое время, видео не ускорено и не смонтировано.
- Претрейнинг на видео: Оффлайн-генерация действий (приготовление еды, уборка, манипуляции с предметами) на основе предварительно обученной модели. Эти примеры показывают способность модели контролировать физические действия в общих сценах.
Исследование «Video = World + Event Stream» опубликовано в arXiv (2607.15038) командой во главе с Lianghua Huang. Следующие шаги включают расширение контроля действий на более широкие интерактивные сценарии, выходящие за рамки простого диалога.
Источник: An-streamer ↗
