Релиз модели10 июля 2026 г., 13:45 МСК🤖 Auto

Vidu S1: Реал-тайм генерация видео голосом на потребительских GPU

Shengshu AI представили Vidu S1 — модель, позволяющая управлять цифровыми персонажами голосом в реальном времени. Генерация 540p видео со скоростью до 42 FPS доступна на обычных видеокартах.

Баннер новости 3295

Революция интерактивности: голос как контроллер

Vidu S1 от лаборатории Shengshu AI — это не просто генератор видео, а система интерактивного взаимодействия. В отличие от традиционных моделей, где вы ждете окончания рендера, здесь пользователь может в любой момент прервать или изменить сценарий с помощью голосовых команд. Цифровой персонаж реагирует на инструкции мгновенно, что открывает возможности для живых трансляций, образовательного контента и интерактивных игр.

Технические характеристики и производительность

Ключевое преимущество Vidu S1 — доступность. Модель способна генерировать видео в разрешении 540p с частотой до 42 кадров в секунду. Это достигается за счет оптимизации архитектуры, позволяющей запускать инференс на потребительских GPU, без необходимости в кластерах A100/H100. Поддерживается генерация бесконечной длины, что критично для долгих сессий взаимодействия.

Поддержка разнообразных аватаров

Система не ограничена одним типом контента. Vidu S1 обучена на разнообразных данных, что позволяет работать с:

  • Реалистичными людьми (референс-фото + голос).
  • Аниме-стилизацией.
  • Домашними животными.
  • Кастомными персонажами по пользовательским изображениям.

Сравнение возможностей

Параметр Vidu S1 Стандартные видео-генераторы
Управление в реальном времени Голосовые команды (Live) Только текстовые промпты (Batch)
Частота кадров До 42 FPS Обычно 8-24 FPS
Разрешение 540p (оптимизировано для скорости) 720p-1080p (часто с задержкой)
Длительность генерации Бесконечная (Infinite-length) Ограничена контекстным окном
Аппаратные требования Потребительские GPU Часто требуются серверные решения

Доступность и документация

Платформа уже доступна для тестирования на сайте vidu.com/vidu-stream. Исследователи могут ознакомиться с технической частью в препринте arXiv:2607.03118. Для разработчиков опубликованы API-документация и гайды по быстрому старту на платформе Feishu. Команда авторов включает Jintao Zhang, Kai Jiang, Marco Chen и других специалистов Shengshu AI.

Источник: Github ↗