Революция в скорости генерации
Команда разработчиков представила метод Distribution Matching as Adversarial Distillation (DMAD), который решает главную проблему быстрых генеративных моделей — компромисс между скоростью и качеством. В отличие от традиционных подходов, требующих десятков шагов денормализации, DMAD позволяет получать высококачественные результаты всего за 4 шага (для видео) и даже за 1 шаг (для изображений).
Ключевые метрики производительности
Метод демонстрирует выдающиеся результаты на бенчмарках ImageNet и COCO, а также в пользовательских тестах предпочтений. Ниже приведено сравнение ключевых показателей:
| Модель / Задача | Количество шагов | Метрика | Значение |
|---|---|---|---|
| ImageNet-64x64 (One-step) | 1 | FID ↓ | 1.04 |
| Text-to-Image (SDXL) | 4 | FID ↓ (COCO-10K) | 14.47 |
| Text-to-Video (Wan2.1-T2V-14B) | 4 | VBench ↑ | 84.6 |
| MiniMax-H3 vs rCM | 4 | Human preference | 85.15% |
Как работает DMAD
Архитектура метода основана на использовании двух голов дискриминатора с общим базовым блоком. Процесс обучения включает:
- Классификацию через распределение: Шум проходит через几步-студента, а затем образцы (ученика, учителя и реальные данные) зашумляются и классифицируются.
- Взвешивание на основе разрыва: Разница в классификации используется для перераспределения весов, что позволяет студенту быстрее обучаться.
- Дистилляция: Итоговое обновление параметров происходит на основе выровненных распределений.
Практическое применение
Метод успешно протестирован на крупных моделях, включая MiniMax-H3 (33B параметров для видео), SDXL и EDM. Генерация видео с использованием MiniMax-H3 за 4 шага демонстрирует кинематографичное качество, сохраняя сложные детали сцен, освещение и движение объектов, что делает технологию перспективной для создания контента в реальном времени.
Бенчмарки
| Бенчмарк | MiniMax-H3 | SDXL |
|---|---|---|
| FID | 1.04% | 14.47% |
Жирным — лучший результат в строке. Источник цифр — официальная публикация.
Источник: Github ↗
