Проблема медленной генерации
Генерация видео с помощью диффузионных моделей или flow-моделей остается вычислительно сложной задачей из-за итеративного процесса сэмплирования. Существующие методы ускорения (SOTA) часто опираются на вариационное дистиллирование оценок (VSD) и состязательные потери. Хотя они обеспечивают высокое качество, эти методы страдают от нестабильности обучения, коллапса мод (mode collapse) и, как следствие, от недостатка разнообразия видео и плавности движения.
Решение: Parallel Decoding Distillation (PDD)
Nvidia предлагает альтернативный подход — PDD. Это упрощенный и масштабируемый метод дистилляции на основе траекторий. Ключевое отличие PDD от традиционного Flow Matching (FM) заключается в том, что при каждой оценке сети PDD продвигается сразу на несколько шагов, тогда как FM делает только один шаг. Это позволяет радикально сократить общее количество необходимых вычислений (NFE — Number of Function Evaluations).
Результаты на моделях LTX-2.3 и Wan2.1
Исследователи протестировали PDD на двух популярных архитектурах: LTX-2.3 и Wan2.1-14B. Метод демонстрирует стабильное качество даже при экстремально низком количестве шагов (4 NFE), что ранее считалось невозможным для сохранения кинематографичности и логики движения.
| Модель | Количество шагов (NFE) | Особенности генерации | Примеры контента |
|---|---|---|---|
| LTX-2.3 | 8 | С использованием апскейлера и рефинера | Король с солдатами в пещере, женщина в лесу, конфликт двух людей |
| Wan2.1-14B | 4 | Базовая дистилляция | Коты-боксеры, птица над церковью, ребенок на качелях, велосипедисты |
| Wan2.1-14B | 4 | Стилизация (Van Gogh) | Астронавт на корове на пляже |
Почему это важно
Снижение количества шагов с типичных 20-50 до 4-8 означает ускорение процесса генерации в несколько раз. Это критически важно для:
- Интерактивного применения: возможность генерации видео в реальном времени или near-real-time.
- Снижения затрат: меньшее количество вычислений снижает стоимость inference для провайдеров облачных сервисов.
- Диверсификации: в отличие от методов на основе VSD, PDD сохраняет разнообразие сгенерированных кадров, избегая «заезженных» паттернов движения.
Метод PDD открывает путь к созданию более быстрых и доступных инструментов для создания видео-контента, делая сложные диффузионные модели практически применимыми в интерактивных сценариях.
Источник: Nvidia ↗
