Суть прорыва: фильтрация ошибки критика
Метод PDMD (Projected Distribution Matching Distillation) решает главную проблему дистилляции диффузионных моделей: накопление ошибок при сокращении шагов генерации. Авторы предлагают простое, но эффективное решение — однострочную проекцию, которая фильтрует ошибку студента, вычитая компонент вектора обновления, параллельный остатку между учителем и студентом.
Ключевое преимущество PDMD — отсутствие необходимости в дополнительных архитектурах, вспомогательных потерях (auxiliary losses) или дополнительных проходах модели. Формула коррекции выглядит так:
r = x0_critic - x0_studentd = d - (d * r).sum() / r.pow(2).sum() * r
Это позволяет «студенту» (ускоренной модели) двигаться в правильном направлении, игнорируя шум, вызванный неточностью критика.
Результаты на MiniMax-H3-33B
В бенчмарке VideoGen-Eval модель MiniMax-H3-33B, дистиллированная с помощью PDMD, достигает показателей, сопоставимых с оригинальным учителем, работающим в 12.5 раз дольше (50 шагов против 4). Метод превосходит предыдущие SOTA-решения, такие как DMD, DMD2, AnyFlow и rCM.
| Метод | NFE | Visual · Total | Visual · Quality | Visual · Dynamic | Audio · PQ |
|---|---|---|---|---|---|
| MiniMax-H3-33B (Teacher) | 50 | 82.41 | 82.22 | 66.67 | 6.567 |
| DMD | 4 | 82.76 | 82.68 | 61.76 | 6.381 |
| DMD2 | 4 | 82.27 | 82.51 | 59.95 | 6.305 |
| AnyFlow | 4 | 81.97 | 81.82 | 64.60 | 6.092 |
| PDMD (Ours) | 4 | 83.17 | 83.25 | 71.83 | 6.530 |
Универсальность и работа с аудио
PDMD демонстрирует стабильность и на других архитектурах, например, на Wan2.1-T2V-1.3B. Здесь метод также лидирует по метрикам динамики (89.72) и общего качества (83.73) среди моделей, использующих 4 шага (NFE=4).
Особое внимание уделено синхронизации аудио и видео. PDMD показывает лучшие результаты по метрике PQ (Perceptual Quality) для аудио, что критично для создания кинематографичных роликов. В пользовательских исследованиях (User Study) с участием 20 аннотаторов PDMD выиграл у DMD2 в 45 случаях против 39, особенно выделяясь в категориях «Визуальное качество» (+25.1% преимущество) и «Качество движения» (+12.1%).
Практическое применение
Галерея проекта демонстрирует генерацию видео разрешением 1344×768 при 24 кадрах в секунду всего за 4 прохода нейросети. Это открывает путь к реальному времени генерации сложного контента: от аэросъемки до детализированных 3D-сцен и аниме-стилизаций, ранее доступных только при длительном обучении.
Источник: Github ↗
