Релиз модели23 сентября 2026 г., 11:46 МСК🤖 Auto

VideoGen-Agent: Принстон и Стэнфорд решили проблему контроля в генерации видео

Исследователи представили мультимодального агента, который использует внешние инструменты для точного контроля физики, идентичности и тайминга в видео. Оценка на VABench выросла с 56.5 до 86.1 баллов.

Баннер новости 8090

Проблема: от хаоса к кинематографичности

Современные модели генерации видео (Text-to-Video) часто не справляются со сложными сценариями, требующими соблюдения физических законов, сохранения идентичности объектов или строгой последовательности событий. Классический подход, когда пользователь вводит один промпт, приводит к тому, что модель игнорирует детали: например, вода может протекать сквозь листья, а объекты — исчезать из кадра.

Команда из Принстонского университета и Стэнфорда представила VideoGen-Agent — систему, которая рассматривает генерацию видео как задачу многошагового использования инструментов (tool-use). Агент не просто генерирует кадр, а планирует сцену, проверяет её и корректирует ошибки в реальном времени.

Архитектура: три фазы работы

VideoGen-Agent базируется на модели Qwen3-VL-8B-Instruct и работает по принципу «Reasoning → Action → Observation». Инструменты разделены на три группы:

  • Augmentation (Аугментация): Поиск в интернете (Serper), поиск изображений и физическое моделирование (PyBullet) для понимания гравитации и столкновений.
  • Generation (Генерация): Использование различных видео-генераторов (T2V, I2V, Motion-to-Video) в зависимости от задачи.
  • Verification (Верификация): Использование моделей обнаружения объектов (Grounding DINO) и оценки глубины (Depth Anything V2) для проверки соответствия видео запросу.

Результаты: VABench и сравнение с лидерами

Для оценки была создана специализированная бенчмарк-платформа VABench из 600 промптов, охватывающих шесть категорий: процедурные знания, идентичность одного/нескольких объектов, физика, композиция сцены и многокадровая структура. Агент обучался с помощью многозадачного агентного обучения с подкреплением (GRPO).

Ключевое достижение — значительный прирост качества по сравнению с базовыми моделями. Ниже приведено сравнение результатов на VABench (оценка от 0 до 100, судья Gemini 3.1 Pro):

Модель PK SI MI PS CS MS Overall
Open-source baselines
CogVideoX-5B 38.9 48.3 37.8 41.6 50.4 30.8 41.3
Wan 2.1-T2V-14B 42.0 46.2 39.5 49.5 60.8 62.0 50.0
Commercial baselines
Seedance 1.0 Pro Fast 55.5 51.4 44.2 46.2 74.6 66.8 56.5
Seedance 2.0 Fast 78.0 75.0 69.0 60.2 87.8 68.9 73.2
VideoGen-Agent (RL)
Toolset 1 (Seedance 1.0) 80.4 75.1 65.3 67.9 83.1 81.7 75.6
Toolset 2 (Seedance 2.0) 92.1 83.2 86.7 69.2 90.7 94.6 86.1

Примечание: PK — Procedural Knowledge, SI — Single-Entity Identity, MI — Multi-Entity Identity, PS — Physics Simulation, CS — Compositional Scene, MS — Multi-Shot.

Почему это важно: масштабируемость через агентов

Главное открытие исследователей заключается в том, что VideoGen-Agent не привязан жестко к одной модели генерации. В конфигурации Toolset 2 исследователи заменили базовый генератор Seedance 1.0 на более мощный Seedance 2.0 без дообучения самого агента. Результат? Общий балл вырос с 75.6 до 86.1.

Это доказывает, что обученный агент-координатор может эффективно использовать любые будущие улучшения в области генерации видео. Люди-оценщики предпочитают видео, сгенерированные VideoGen-Agent, в 84.3% случаев по сравнению с сильнейшими изолированными моделями-базовыми линиями.

Бенчмарки

БенчмаркVideoGen-Agent (Toolset 1)VideoGen-Agent (Toolset 2)Kling 3.0Seedance 2.0 Fast
VABench75.6%86.1%65.2%73.2%

Жирным — лучший результат в строке. Источник цифр — официальная публикация.

Источник: Github ↗