Революция в мультимодальной генерации
Команда DreamX официально представила DreamX-Creator 1.0 — исследовательский фреймворк для нативной совместной генерации аудио и видео. В отличие от традиционных моделей, которые сначала создают видео, а затем добавляют звук, DreamX-Creator обрабатывает оба потока данных параллельно. Это позволяет достичь беспрецедентного уровня семантической согласованности и точной синхронизации звуковых эффектов с визуальными событиями.
Технические инновации: от архитектуры до обучения
В основе системы лежит базовый генератор, который моделирует специализированные потоки видео и аудио. Ключевыми технологическими решениями стали:
- Gated Cross-Modal Attention: механизм, позволяющий аудиостимулам влиять на генерацию видео и наоборот, обеспечивая двустороннее взаимодействие модальностей.
- Progressive Joint Training: прогрессивное совместное обучение, стабилизирующее процесс генерации сложных мультимодальных данных.
- Audio-Video Reinforcement Learning: использование обучения с подкреплением в сочетании с модально-осознанным мультимодальным фидбеком для улучшения качества и семантики.
Результаты и метрики
Финальный этап работы системы — Autoregressive 1-Step 2K Refinement — апскейлит сгенерированный контент до разрешения 2K, сохраняя исходное движение и тайминг, выровненный с аудио. Ниже приведена сравнительная характеристика ключевых компонентов системы:
| Компонент | Функция | Результат |
|---|---|---|
| Base Generator | Нативная совместная генерация | Двустороннее взаимодействие аудио и видео через Gated Cross-Modal Attention |
| RL Module | Оптимизация качества | Улучшение семантической согласованности и синхронизации через Audio-Video RL |
| Refinement Stage | Апскейлинг | Повышение разрешения до 2K за 1 шаг без потери контента и движения |
Доступность и лицензирование
Проект открыт для сообщества. Код, веса моделей, конфигурации и инструменты оценки доступны на GitHub по лицензии Apache 2.0. Технический отчет опубликован на arXiv (eprint 2608.31106) в августе 2026 года. Авторы выражают благодарность командам Wan и OpenMOSS за вклад в развитие открытых решений в области генеративного ИИ.
Источник: Github ↗
