Главная/Блог/Обзор/Google AI Video Co-Director: 4 агента…
Обзор3 мин чтения · 28 сентября 2026 г.

Google AI Video Co-Director: 4 агента для 10-минутных видео

Разбор архитектуры Google AI Video Co-Director: как 4 агента решают проблему дрейфа идентичности и создают связные видео длиной до 10 минут без дообучения.

Google AI Video Co-Director: 4 агента для 10-минутных видео

Google Research представил систему AI Video Co-Director — набор из четырех агентных фреймворков, предназначенных для генерации связных видео длительностью в несколько минут. Основная проблема текущих пайплайнов (diffusion-моделей) — это «дрейф семантики» (semantic drift) и каскадные ошибки: персонажи меняют одежду, а реквизит исчезает между кадрами. Google решает это через глобальную оптимизацию и отслеживание состояния мира, используя слой оркестрации над моделями Gemini и Veo.

01Архитектура: 4 агента для полного цикла

Система не требует дообучения базовых моделей (training-free). Она работает как надстройка, управляющая генерацией через четыре специализированных модуля:

  • Co-Director: Планирование на основе многоармочного бандита (Multi-Armed Bandit). Оркестратор выбирает стратегию, а Pre-Production Agent создает раскадровку. MLLM Judge оценивает результат и возвращает награду для оптимизации стратегии.
  • CANVAS: Персистентная визуальная память. Отслеживает персонажей, локации и объекты. Позволяет возвращать ранее созданные визуальные якоря, предотвращая изменение внешности героев.
  • A²RD (Agentic Autoregressive Diffusion): Архитектура для длинных видео. Использует цикл Retrieve, Synthesize, Refine, Update. Агент переключается между экстраполяцией (новые события) и интерполяцией (возвращение сущностей). Позволяет генерировать непрерывные видео до 10 минут.
  • VQQA (Video Quality Question Answering): Замкнутый цикл улучшения промптов. VLM-критики генерируют вопросы к визуалу, создавая «семантические градиенты» для переписывания текста. Global Selection выбирает лучший вариант из всех итераций, а не последний.
💡
Ключевое отличие. В отличие от простых цепочек промптов, здесь используется задача распределения кредита (credit assignment): система точно знает, какой промпт вызвал ошибку в финальном видео, и корректирует только его.

02Бенчмарки и результаты

Google представил три новых набора данных для тестирования: GenAD-Bench (рекламные сценарии), HardContinuityBench (сложные сцены с повторами) и LVBench-C (исчезновение ключевых активов на 10+ сегментов).

Результаты показывают значительное преимущество перед базовыми моделями (Veo 3.1, Kling 3.0, Wan 2.6) и другими агентными решениями:

Метрика / Модель Google Co-Director StoryMem (ByteDance) MovieAgent AutoStudio
GenAD-Bench Score 81.4 — — —
Human Rating (из 5) 3.96 — — —
Consistency (CANVAS) +21.6% фон, +9.6% персонажи Memory-to-Video Hierarchical planning Subject manager
Max Duration 10 минут (A²RD) ~1 минута Не указано N/A (изображения)
Training No fine-tuning LoRA Per-character LoRA Training-free

В тесте с кражей в музее система CANVAS сохранила кепку вора и драгоценный камень, тогда как AutoStudio потерял кепку, а Gemini-3.1-Pro изменил камень. A²RD обеспечил до 30% лучшей консистентности и 20% лучшей нарративной связности в видео длиной 1–10 минут.

03Практическое применение и доступность

Решение является модель-агностичным, но в текущей реализации опирается на Gemini и Veo. Выходные данные автоматически маркируются водяным знаком SynthID.

Код для Co-Director и A²RD уже доступен на GitHub. Фреймворк CANVAS выйдет позже. Полноценного продукта для конечных пользователей пока нет, это исследовательский стек.

⚠️
Важно для разработчиков. Система не требует доступа к внутренностям моделей (black-box), что упрощает интеграцию, но накладывает ограничения на контроль над низкоуровневыми параметрами генерации.

04Кому подойдёт / что запустится

  • Продакшн-студии: Для создания рекламных роликов и короткометражек, где критична идентичность актеров и реквизита на протяжении всего сюжета.
  • Разработчики AI-агентов: Изучать архитектуру A²RD для реализации долгосрочной памяти в видео-генераторах. Код Co-Director и A²RD открыт для форков.
  • Контент-мейкеры: Пока недоступно как готовый сервис. Требуется сборка собственного пайплайна на базе API Gemini/Veo и внедрение агентов.

Для локального запуска на РФ-железе (RTX 3090/4090) текущая архитектура Google не применима напрямую из-за зависимости от облачных API Gemini и Veo. Однако принципы CANVAS (векторная память состояний) можно адаптировать под локальные LLM/VLM стеки (например, Llama 3 + Qwen-VL) для создания собственных решений по удержанию консистентности.

Источник: MarkTechPost ↗