Релиз модели24 июля 2026 г., 11:46 МСК🤖 Auto

Self Gradient Forcing: прорыв в генерации длинных видео от 5 секунд до минут

Исследователи представили метод Self Gradient Forcing (SGF), устраняющий разрыв в градиентах при обучении autoregressive-моделей. SGF позволяет генерировать стабильные видео длительностью в несколько минут, обучаясь всего на 5-секундных отрезках.

Баннер новости 4284

Проблема: «Разрыв контекста» в autoregressive-генерации

Современные методы диффузии видео, использующие autoregressive подход (Self Forcing), обучаются на историях, сгенерированных самой моделью. Это снижает bias экспозиции, но создает критическую проблему: кэш ключей и значений (KV-cache) для предыдущих кадров фиксируется как «замороженное состояние». Будущие кадры не могут корректировать то, как ранние латенты записываются в память, что приводит к деградации качества при увеличении длительности видео. Авторы называют это historical context-gradient gap (разрыв градиента исторического контекста).

Решение: Двухэтапное обучение SGF

Метод Self Gradient Forcing (SGF) восстанавливает недостающий сигнал обучения без необходимости обратного распространения градиентов через всю последовательную развертку. Процесс состоит из двух проходов:

  • Pass 1: Стандартный autoregressive rollout без градиентов, имитирующий инференс. На выбранном шаге денoising фиксируются сгенерированный контекст и зашумленные латенты.
  • Pass 2: Параллельная реконструкция контекстных градиентов. Сгенерированный контекст используется как вход с остановкой градиентов (stop-gradient), модель пересчитывает KV-представления и причинно-следственное внимание. Это позволяет потерям будущих кадров обучать модель эффективнее кодировать контекст в память.

Результаты: Экстраполяция от 5 секунд до нескольких минут

Эксперименты показали, что SGF превосходит базовый Self Forcing (SF) и его модификации (с би- и каузальным ODE) по стабильности сюжета, сохранению идентичности персонажей и целостности фона. Ключевое достижение — возможность экстраполяции видео длительностью в несколько минут, используя обучающую выборку всего в 5 секунд.

Метод Стабильность фона/сюжета Идентичность объекта Временная стабильность
Self Forcing (SF) Низкая (дрожание, артефакты) Плохая (искажение черт) Низкая
SF + Bi-directional ODE Средняя Удовлетворительная Средняя
SF + Causal ODE Средняя Удовлетворительная Средняя
SGF (Ours) Высокая Высокая Высокая

Визуальные примеры и применение

Тестирование проводилось в режимах frame-wise и chunk-wise генерации. На 60-секундных и 240-секундных видео SGF демонстрирует отсутствие «дрейфа» сцены. Примеры включают:

  • Панду в кафе в стиле Ван Гога (сохранение стиля и деталей одежды).
  • Процесс макияжа глаз (стабильность ракурса и освещения).
  • Кинокадры с дождем и неоновыми огнями (физика капель и отражений).

Метод открывает путь к созданию длинных нарративных видео без необходимости дорогостоящего обучения на огромных датасетах длительных клипов.

Источник: Github ↗