Инструменты30 июля 2026 г., 11:45 МСК🤖 Auto

Nvidia PDD: ускорение генерации видео в 2-4 раза без потери качества

Лаборатория Nvidia представила Parallel Decoding Distillation (PDD) — метод дистилляции видео-моделей, позволяющий сократить количество шагов генерации (NFE) до 4-8 при сохранении высокой детализации и разнообразия.

Баннер новости 4707

Проблема медленной генерации

Генерация видео с помощью диффузионных моделей или flow-моделей остается вычислительно сложной задачей из-за итеративного процесса сэмплирования. Существующие методы ускорения (SOTA) часто опираются на вариационное дистиллирование оценок (VSD) и состязательные потери. Хотя они обеспечивают высокое качество, эти методы страдают от нестабильности обучения, коллапса мод (mode collapse) и, как следствие, от недостатка разнообразия видео и плавности движения.

Решение: Parallel Decoding Distillation (PDD)

Nvidia предлагает альтернативный подход — PDD. Это упрощенный и масштабируемый метод дистилляции на основе траекторий. Ключевое отличие PDD от традиционного Flow Matching (FM) заключается в том, что при каждой оценке сети PDD продвигается сразу на несколько шагов, тогда как FM делает только один шаг. Это позволяет радикально сократить общее количество необходимых вычислений (NFE — Number of Function Evaluations).

Результаты на моделях LTX-2.3 и Wan2.1

Исследователи протестировали PDD на двух популярных архитектурах: LTX-2.3 и Wan2.1-14B. Метод демонстрирует стабильное качество даже при экстремально низком количестве шагов (4 NFE), что ранее считалось невозможным для сохранения кинематографичности и логики движения.

Модель Количество шагов (NFE) Особенности генерации Примеры контента
LTX-2.3 8 С использованием апскейлера и рефинера Король с солдатами в пещере, женщина в лесу, конфликт двух людей
Wan2.1-14B 4 Базовая дистилляция Коты-боксеры, птица над церковью, ребенок на качелях, велосипедисты
Wan2.1-14B 4 Стилизация (Van Gogh) Астронавт на корове на пляже

Почему это важно

Снижение количества шагов с типичных 20-50 до 4-8 означает ускорение процесса генерации в несколько раз. Это критически важно для:

  • Интерактивного применения: возможность генерации видео в реальном времени или near-real-time.
  • Снижения затрат: меньшее количество вычислений снижает стоимость inference для провайдеров облачных сервисов.
  • Диверсификации: в отличие от методов на основе VSD, PDD сохраняет разнообразие сгенерированных кадров, избегая «заезженных» паттернов движения.

Метод PDD открывает путь к созданию более быстрых и доступных инструментов для создания видео-контента, делая сложные диффузионные модели практически применимыми в интерактивных сценариях.

Источник: Nvidia ↗