Релиз модели6 октября 2026 г., 13:48 МСК🤖 Auto

PDMD: Однострочная проекция для ускорения диффузии в 12.5 раз

Исследователи из UC San Diego и ByteDance представили PDMD — метод дистилляции, который сокращает шаги генерации видео с 50 до 4, сохраняя качество учителя MiniMax-H3-33B.

Баннер новости 9023

Суть прорыва: фильтрация ошибки критика

Метод PDMD (Projected Distribution Matching Distillation) решает главную проблему дистилляции диффузионных моделей: накопление ошибок при сокращении шагов генерации. Авторы предлагают простое, но эффективное решение — однострочную проекцию, которая фильтрует ошибку студента, вычитая компонент вектора обновления, параллельный остатку между учителем и студентом.

Ключевое преимущество PDMD — отсутствие необходимости в дополнительных архитектурах, вспомогательных потерях (auxiliary losses) или дополнительных проходах модели. Формула коррекции выглядит так:

  • r = x0_critic - x0_student
  • d = d - (d * r).sum() / r.pow(2).sum() * r

Это позволяет «студенту» (ускоренной модели) двигаться в правильном направлении, игнорируя шум, вызванный неточностью критика.

Результаты на MiniMax-H3-33B

В бенчмарке VideoGen-Eval модель MiniMax-H3-33B, дистиллированная с помощью PDMD, достигает показателей, сопоставимых с оригинальным учителем, работающим в 12.5 раз дольше (50 шагов против 4). Метод превосходит предыдущие SOTA-решения, такие как DMD, DMD2, AnyFlow и rCM.

Метод NFE Visual · Total Visual · Quality Visual · Dynamic Audio · PQ
MiniMax-H3-33B (Teacher) 50 82.41 82.22 66.67 6.567
DMD 4 82.76 82.68 61.76 6.381
DMD2 4 82.27 82.51 59.95 6.305
AnyFlow 4 81.97 81.82 64.60 6.092
PDMD (Ours) 4 83.17 83.25 71.83 6.530

Универсальность и работа с аудио

PDMD демонстрирует стабильность и на других архитектурах, например, на Wan2.1-T2V-1.3B. Здесь метод также лидирует по метрикам динамики (89.72) и общего качества (83.73) среди моделей, использующих 4 шага (NFE=4).

Особое внимание уделено синхронизации аудио и видео. PDMD показывает лучшие результаты по метрике PQ (Perceptual Quality) для аудио, что критично для создания кинематографичных роликов. В пользовательских исследованиях (User Study) с участием 20 аннотаторов PDMD выиграл у DMD2 в 45 случаях против 39, особенно выделяясь в категориях «Визуальное качество» (+25.1% преимущество) и «Качество движения» (+12.1%).

Практическое применение

Галерея проекта демонстрирует генерацию видео разрешением 1344×768 при 24 кадрах в секунду всего за 4 прохода нейросети. Это открывает путь к реальному времени генерации сложного контента: от аэросъемки до детализированных 3D-сцен и аниме-стилизаций, ранее доступных только при длительном обучении.

Источник: Github ↗