Релиз модели28 сентября 2026 г., 06:23 МСК🤖 Auto

Google представила AI-со-режиссера: 4 фреймворка для 10-минутных видео

Google Research выпустила систему AI Video Co-Director, решающую проблему «дрейфа идентичности» в длинных видео. Система использует 4 агентных фреймворка для создания связных историй длительностью до 10 минут.

Баннер новости 8392

Проблема длинных видео: дрейф и каскадные ошибки

Современные диффузионные модели генерируют качественные короткие клипы, но при склейке их в длинные сюжеты возникают критические сбои. Google Research выделяет две главные проблемы: семантический дрейф (смена одежды, фона или реквизита между кадрами) и каскадные ошибки (когда ошибка на раннем этапе портит весь последующий контент). Традиционные пайплайны с ручными промптами не справляются с этой «проблемой распределения кредита».

Архитектура решения: 4 агентных фреймворка

Решение Google работает как оркестрационный слой поверх моделей Gemini и Veo (модель-агностично) и использует водяные знаки SynthID. Система состоит из четырех ключевых компонентов:

  • Co-Director (принят в COLM 2026): использует алгоритм multi-armed bandit для выбора стратегии, нарратива и эстетики. Агент-судья (MLLM Judge) оценивает результат и возвращает награду для оптимизации.
  • CANVAS (принят в EMNLP 2026): обеспечивает персистентную визуальную память. Система отслеживает персонажей, локации и состояние объектов, предотвращая исчезновение деталей (например, кепки вора или камня) при возвращении сцены.
  • A²RD (Agentic Autoregressive Diffusion): архитектура без дообучения (training-free). Работает по циклу «Retrieve, Synthesize, Refine, Update» с мультимодальной памятью. Позволяет генерировать видео длительностью от 1 до 10 минут.
  • VQQA (Video Quality Question Answering): закрытый цикл улучшения промптов. VLM-критики генерируют визуальные вопросы, создавая «семантические градиенты» для переписывания текста. Глобальный выбор берет лучшее видео из всех итераций, а не последнее.

Результаты бенчмарков

Google представила три новых набора данных: GenAD-Bench (реклама), HardContinuityBench (сложная непрерывность) и LVBench-C (возвращение ключевых активов). Результаты показывают значительное превосходство над базовыми моделями:

ФреймворкКлючевая метрикаРезультат / Преимущество
Co-DirectorGenAD-Bench81.4 балла (против 75.7 у random search)
Co-DirectorЧеловеческая оценка3.96 из 5
CANVASНепрерывность фона+21.6%
CANVASКонсистентность персонажей+9.6%
CANVASКонсистентность реквизита+7.6%
A²RDКонсистентность (1-10 мин)До +30%
A²RDНарративная связностьДо +20%
VQQAT2V-CompBench+11.57% абсолютный прирост
VQQAVBench2+8.43% абсолютный прирост

Сравнение с конкурентами

В отличие от StoryMem (ByteDance) и MovieAgent, которые часто требуют дообучения (LoRA) или работают с короткими отрезками, решение Google является training-free и масштабируется на 10-минутные фильмы. Код для Co-Director и A²RD уже доступен на GitHub, CANVAS — в разработке.

Источник: MarkTechPost ↗