Проблема длинных видео: дрейф и каскадные ошибки
Современные диффузионные модели генерируют качественные короткие клипы, но при склейке их в длинные сюжеты возникают критические сбои. Google Research выделяет две главные проблемы: семантический дрейф (смена одежды, фона или реквизита между кадрами) и каскадные ошибки (когда ошибка на раннем этапе портит весь последующий контент). Традиционные пайплайны с ручными промптами не справляются с этой «проблемой распределения кредита».
Архитектура решения: 4 агентных фреймворка
Решение Google работает как оркестрационный слой поверх моделей Gemini и Veo (модель-агностично) и использует водяные знаки SynthID. Система состоит из четырех ключевых компонентов:
- Co-Director (принят в COLM 2026): использует алгоритм multi-armed bandit для выбора стратегии, нарратива и эстетики. Агент-судья (MLLM Judge) оценивает результат и возвращает награду для оптимизации.
- CANVAS (принят в EMNLP 2026): обеспечивает персистентную визуальную память. Система отслеживает персонажей, локации и состояние объектов, предотвращая исчезновение деталей (например, кепки вора или камня) при возвращении сцены.
- A²RD (Agentic Autoregressive Diffusion): архитектура без дообучения (training-free). Работает по циклу «Retrieve, Synthesize, Refine, Update» с мультимодальной памятью. Позволяет генерировать видео длительностью от 1 до 10 минут.
- VQQA (Video Quality Question Answering): закрытый цикл улучшения промптов. VLM-критики генерируют визуальные вопросы, создавая «семантические градиенты» для переписывания текста. Глобальный выбор берет лучшее видео из всех итераций, а не последнее.
Результаты бенчмарков
Google представила три новых набора данных: GenAD-Bench (реклама), HardContinuityBench (сложная непрерывность) и LVBench-C (возвращение ключевых активов). Результаты показывают значительное превосходство над базовыми моделями:
| Фреймворк | Ключевая метрика | Результат / Преимущество |
|---|---|---|
| Co-Director | GenAD-Bench | 81.4 балла (против 75.7 у random search) |
| Co-Director | Человеческая оценка | 3.96 из 5 |
| CANVAS | Непрерывность фона | +21.6% |
| CANVAS | Консистентность персонажей | +9.6% |
| CANVAS | Консистентность реквизита | +7.6% |
| A²RD | Консистентность (1-10 мин) | До +30% |
| A²RD | Нарративная связность | До +20% |
| VQQA | T2V-CompBench | +11.57% абсолютный прирост |
| VQQA | VBench2 | +8.43% абсолютный прирост |
Сравнение с конкурентами
В отличие от StoryMem (ByteDance) и MovieAgent, которые часто требуют дообучения (LoRA) или работают с короткими отрезками, решение Google является training-free и масштабируется на 10-минутные фильмы. Код для Co-Director и A²RD уже доступен на GitHub, CANVAS — в разработке.
Источник: MarkTechPost ↗
