Инструменты1 сентября 2026 г., 17:46 МСК🤖 Auto

DreamX-Creator 1.0: Нейросеть для синхронного генерации видео и аудио в 2K

Команда DreamX представила фреймворк DreamX-Creator 1.0, способный создавать видео и аудио одновременно, обеспечивая идеальную синхронизацию и качество 2K.

Баннер новости 6506

Революция в мультимодальной генерации

Команда DreamX официально представила DreamX-Creator 1.0 — исследовательский фреймворк для нативной совместной генерации аудио и видео. В отличие от традиционных моделей, которые сначала создают видео, а затем добавляют звук, DreamX-Creator обрабатывает оба потока данных параллельно. Это позволяет достичь беспрецедентного уровня семантической согласованности и точной синхронизации звуковых эффектов с визуальными событиями.

Технические инновации: от архитектуры до обучения

В основе системы лежит базовый генератор, который моделирует специализированные потоки видео и аудио. Ключевыми технологическими решениями стали:

  • Gated Cross-Modal Attention: механизм, позволяющий аудиостимулам влиять на генерацию видео и наоборот, обеспечивая двустороннее взаимодействие модальностей.
  • Progressive Joint Training: прогрессивное совместное обучение, стабилизирующее процесс генерации сложных мультимодальных данных.
  • Audio-Video Reinforcement Learning: использование обучения с подкреплением в сочетании с модально-осознанным мультимодальным фидбеком для улучшения качества и семантики.

Результаты и метрики

Финальный этап работы системы — Autoregressive 1-Step 2K Refinement — апскейлит сгенерированный контент до разрешения 2K, сохраняя исходное движение и тайминг, выровненный с аудио. Ниже приведена сравнительная характеристика ключевых компонентов системы:

Компонент Функция Результат
Base Generator Нативная совместная генерация Двустороннее взаимодействие аудио и видео через Gated Cross-Modal Attention
RL Module Оптимизация качества Улучшение семантической согласованности и синхронизации через Audio-Video RL
Refinement Stage Апскейлинг Повышение разрешения до 2K за 1 шаг без потери контента и движения

Доступность и лицензирование

Проект открыт для сообщества. Код, веса моделей, конфигурации и инструменты оценки доступны на GitHub по лицензии Apache 2.0. Технический отчет опубликован на arXiv (eprint 2608.31106) в августе 2026 года. Авторы выражают благодарность командам Wan и OpenMOSS за вклад в развитие открытых решений в области генеративного ИИ.

Источник: Github ↗