Проблема: «Разрыв контекста» в autoregressive-генерации
Современные методы диффузии видео, использующие autoregressive подход (Self Forcing), обучаются на историях, сгенерированных самой моделью. Это снижает bias экспозиции, но создает критическую проблему: кэш ключей и значений (KV-cache) для предыдущих кадров фиксируется как «замороженное состояние». Будущие кадры не могут корректировать то, как ранние латенты записываются в память, что приводит к деградации качества при увеличении длительности видео. Авторы называют это historical context-gradient gap (разрыв градиента исторического контекста).
Решение: Двухэтапное обучение SGF
Метод Self Gradient Forcing (SGF) восстанавливает недостающий сигнал обучения без необходимости обратного распространения градиентов через всю последовательную развертку. Процесс состоит из двух проходов:
- Pass 1: Стандартный autoregressive rollout без градиентов, имитирующий инференс. На выбранном шаге денoising фиксируются сгенерированный контекст и зашумленные латенты.
- Pass 2: Параллельная реконструкция контекстных градиентов. Сгенерированный контекст используется как вход с остановкой градиентов (stop-gradient), модель пересчитывает KV-представления и причинно-следственное внимание. Это позволяет потерям будущих кадров обучать модель эффективнее кодировать контекст в память.
Результаты: Экстраполяция от 5 секунд до нескольких минут
Эксперименты показали, что SGF превосходит базовый Self Forcing (SF) и его модификации (с би- и каузальным ODE) по стабильности сюжета, сохранению идентичности персонажей и целостности фона. Ключевое достижение — возможность экстраполяции видео длительностью в несколько минут, используя обучающую выборку всего в 5 секунд.
| Метод | Стабильность фона/сюжета | Идентичность объекта | Временная стабильность |
|---|---|---|---|
| Self Forcing (SF) | Низкая (дрожание, артефакты) | Плохая (искажение черт) | Низкая |
| SF + Bi-directional ODE | Средняя | Удовлетворительная | Средняя |
| SF + Causal ODE | Средняя | Удовлетворительная | Средняя |
| SGF (Ours) | Высокая | Высокая | Высокая |
Визуальные примеры и применение
Тестирование проводилось в режимах frame-wise и chunk-wise генерации. На 60-секундных и 240-секундных видео SGF демонстрирует отсутствие «дрейфа» сцены. Примеры включают:
- Панду в кафе в стиле Ван Гога (сохранение стиля и деталей одежды).
- Процесс макияжа глаз (стабильность ракурса и освещения).
- Кинокадры с дождем и неоновыми огнями (физика капель и отражений).
Метод открывает путь к созданию длинных нарративных видео без необходимости дорогостоящего обучения на огромных датасетах длительных клипов.
Источник: Github ↗
