Проблема: коллапс мод в DMD
Авторегрессионные (AR) модели диффузии показывают высокий потенциал для генерации видео в реальном времени. Однако современные методы дистилляции, такие как Distribution Matching Distillation (DMD), часто приводят к проблемам с визуальным качеством: видео страдают от перенасыщения цветов (over-saturation) и избыточного сглаживания (over-smoothing).
Причина кроется в поведении reverse KL-объектива в DMD, которое заставляет распределение студента «схлопываться» к нескольким модам распределения учителя. Это ограничивает разнообразие и реализм генерируемого контента.
Решение: Dual-Noise Masking Rollout
Команда предлагает Mask Forcing — стратегию двойного шумового маскирования, которая вносит возмущения в процесс самопрогона (self-rollout) AR-студента. Ключевые особенности:
- Принцип действия: Во время самопрогона случайным образом маскируются пространственные и временные оси, заменяя зашумленные токены на более чистые сигналы.
- Эффект: Это заставляет студента исследовать более широкие области распределения учителя, предотвращая коллапс мод. Чистые токены также служат направляющими (guidance) для денормализации зашумленных, снижая накопление ошибок.
- Интеграция: Метод не требует изменения архитектуры модели, учителя или процедуры инференса. Он совместим с chunk-wise и frame-wise настройками.
Результаты: скорость сходимости и качество
Эксперименты показали, что Mask Forcing ускоряет сходимость и улучшает метрики визуального качества по сравнению с базовыми методами дистилляции. Оценка проводилась с использованием метрик HPSv3 (человеческие предпочтения), CMMD (CLIP Maximum Mean Discrepancy) и VMMD (V-JEPA2 Maximum Mean Discrepancy).
| Метрика / Аспект | Базовый метод (Baseline) | Базовый метод + Mask Forcing |
|---|---|---|
| Скорость сходимости (2000 шагов) | Медленная стабилизация метрик | Быстрая стабилизация, более высокие значения с ранних шагов |
| Визуальное качество (HPSv3) | Ниже, присутствует перенасыщение | Выше, естественные тона и текстуры |
| Выравнивание распределения (CMMD/VMMD) | Больше расхождение с учителем | Лучшее соответствие распределению учителя |
| Требования к данным | — | Не требует реальных видео или дообучения |
Почему это важно
Mask Forcing позволяет значительно повысить реализм и детализацию видео, генерируемых легкими AR-моделями, без увеличения вычислительных затрат на этапе инференса или необходимости сбора огромных датасетов реальных видео. Это делает технологию привлекательной для внедрения в приложения реального времени, где важны как скорость, так и качество картинки.
Источник: Github ↗
