Релиз модели20 июля 2026 г., 15:45 МСК🤖 Auto

Wan-Streamer v0.3: от чата к миру. Новый подход к видео-генерации

Команда An-streamer представила Wan-Streamer v0.3, модель, разделяющую видео на «мир» и «события». Это позволяет создавать фотореалистичных аватаров с естественными жестами и полной синхронизацией аудио/видео в реальном времени.

Баннер новости 3951

Архитектура: Мир + Поток событий

Главное нововведение Wan-Streamer v0.3 — отказ от монолитного подхода к генерации видео. Модель теперь разделяет контент на две независимые части:

  • World (Мир): Статичные элементы, требующие долгосрочной согласованности. Сюда входят фон, внешность персонажа, освещение и фоновые звуки. Эта часть загружается один раз.
  • Event Stream (Поток событий): Динамические изменения во времени. Речь, мимика, жесты, движение камеры и взаимодействие с объектами. Эти элементы генерируются пошагово, синхронно с входными данными пользователя.

Такой подход позволяет использовать обычные видео для обучения: модель сначала «понимает» сцену, а затем учится предсказывать, что произойдет дальше. Это открывает путь к применению не только в чатах, но и в навигации роботов (embodied navigation) и симуляциях.Свободные действия (Free-form Behavior)

В отличие от версий 0.1 и 0.2, где аватары лишь говорили и кивали, v0.3 поддерживает свободные действия, описанные естественным языком. Модель может выполнять сложные физические манипуляции, такие как взятие предметов, повороты или изменение позы, интегрируя их в речь без предварительной хореографии.

Пример работы модели:

  • (reaches into the grass and picks up a green leaf) — «(тянется в траву и берет зеленый лист)»
  • Look what I found. — «Посмотри, что я нашел.»
  • (covers mouth in surprise) — «(закрывает рот от удивления)»

Действия и речь генерируются в едином потоке, что обеспечивает естественную тайминговую синхронизацию.Технические характеристики и сравнение версий

Wan-Streamer v0.3 сохраняет высокую скорость инференса, характерную для предыдущих релизов, но значительно расширяет функционал. Модель работает в режиме full-duplex (полнодуплексная связь), обрабатывая ввод с камеры, микрофона и текста пользователя, генерируя ответное видео и аудио с задержкой, приемлемой для живого диалога.

Параметр Wan-Streamer v0.1 Wan-Streamer v0.2 Wan-Streamer v0.3
Основной фокус Энд-ту-энд аудио/видео Повышенное разрешение Обучение на видео + свободные действия
Поведение агента Речь + слушание Речь + слушание (высокая точность) Речь + свободные действия (жесты, манипуляции)
Разрешение видео 192×336 @ 25 fps 640×368 @ 25 fps 640×368 @ 25 fps
Задержка (Latency) ~200 мс (модель) / ~550 мс (общая) ~200 мс (модель) / ~550 мс (общая) ~200 мс (модель) / ~550 мс (общая)
Архитектура Thinker + 1 GPU Performer Thinker + параллельный Performer Thinker + параллельный Performer

Демонстрации и применение

В релизе представлены два типа демо:

  1. Реальные диалоги: Полнодуплексные сессии с немецким инженером в мастерской и итальянским шеф-поваром на кухне. Задержка включает сетевое время, видео не ускорено и не смонтировано.
  2. Претрейнинг на видео: Оффлайн-генерация действий (приготовление еды, уборка, манипуляции с предметами) на основе предварительно обученной модели. Эти примеры показывают способность модели контролировать физические действия в общих сценах.

Исследование «Video = World + Event Stream» опубликовано в arXiv (2607.15038) командой во главе с Lianghua Huang. Следующие шаги включают расширение контроля действий на более широкие интерактивные сценарии, выходящие за рамки простого диалога.

Источник: An-streamer ↗