Google Research представил систему AI Video Co-Director — набор из четырех агентных фреймворков, предназначенных для генерации связных видео длительностью в несколько минут. Основная проблема текущих пайплайнов (diffusion-моделей) — это «дрейф семантики» (semantic drift) и каскадные ошибки: персонажи меняют одежду, а реквизит исчезает между кадрами. Google решает это через глобальную оптимизацию и отслеживание состояния мира, используя слой оркестрации над моделями Gemini и Veo.
01Архитектура: 4 агента для полного цикла
Система не требует дообучения базовых моделей (training-free). Она работает как надстройка, управляющая генерацией через четыре специализированных модуля:
- Co-Director: Планирование на основе многоармочного бандита (Multi-Armed Bandit). Оркестратор выбирает стратегию, а Pre-Production Agent создает раскадровку. MLLM Judge оценивает результат и возвращает награду для оптимизации стратегии.
- CANVAS: Персистентная визуальная память. Отслеживает персонажей, локации и объекты. Позволяет возвращать ранее созданные визуальные якоря, предотвращая изменение внешности героев.
- A²RD (Agentic Autoregressive Diffusion): Архитектура для длинных видео. Использует цикл Retrieve, Synthesize, Refine, Update. Агент переключается между экстраполяцией (новые события) и интерполяцией (возвращение сущностей). Позволяет генерировать непрерывные видео до 10 минут.
- VQQA (Video Quality Question Answering): Замкнутый цикл улучшения промптов. VLM-критики генерируют вопросы к визуалу, создавая «семантические градиенты» для переписывания текста. Global Selection выбирает лучший вариант из всех итераций, а не последний.
02Бенчмарки и результаты
Google представил три новых набора данных для тестирования: GenAD-Bench (рекламные сценарии), HardContinuityBench (сложные сцены с повторами) и LVBench-C (исчезновение ключевых активов на 10+ сегментов).
Результаты показывают значительное преимущество перед базовыми моделями (Veo 3.1, Kling 3.0, Wan 2.6) и другими агентными решениями:
| Метрика / Модель | Google Co-Director | StoryMem (ByteDance) | MovieAgent | AutoStudio |
|---|---|---|---|---|
| GenAD-Bench Score | 81.4 | — | — | — |
| Human Rating (из 5) | 3.96 | — | — | — |
| Consistency (CANVAS) | +21.6% фон, +9.6% персонажи | Memory-to-Video | Hierarchical planning | Subject manager |
| Max Duration | 10 минут (A²RD) | ~1 минута | Не указано | N/A (изображения) |
| Training | No fine-tuning | LoRA | Per-character LoRA | Training-free |
В тесте с кражей в музее система CANVAS сохранила кепку вора и драгоценный камень, тогда как AutoStudio потерял кепку, а Gemini-3.1-Pro изменил камень. A²RD обеспечил до 30% лучшей консистентности и 20% лучшей нарративной связности в видео длиной 1–10 минут.
03Практическое применение и доступность
Решение является модель-агностичным, но в текущей реализации опирается на Gemini и Veo. Выходные данные автоматически маркируются водяным знаком SynthID.
Код для Co-Director и A²RD уже доступен на GitHub. Фреймворк CANVAS выйдет позже. Полноценного продукта для конечных пользователей пока нет, это исследовательский стек.
04Кому подойдёт / что запустится
- Продакшн-студии: Для создания рекламных роликов и короткометражек, где критична идентичность актеров и реквизита на протяжении всего сюжета.
- Разработчики AI-агентов: Изучать архитектуру A²RD для реализации долгосрочной памяти в видео-генераторах. Код Co-Director и A²RD открыт для форков.
- Контент-мейкеры: Пока недоступно как готовый сервис. Требуется сборка собственного пайплайна на базе API Gemini/Veo и внедрение агентов.
Для локального запуска на РФ-железе (RTX 3090/4090) текущая архитектура Google не применима напрямую из-за зависимости от облачных API Gemini и Veo. Однако принципы CANVAS (векторная память состояний) можно адаптировать под локальные LLM/VLM стеки (например, Llama 3 + Qwen-VL) для создания собственных решений по удержанию консистентности.
Источник: MarkTechPost ↗
