Проблема: от хаоса к кинематографичности
Современные модели генерации видео (Text-to-Video) часто не справляются со сложными сценариями, требующими соблюдения физических законов, сохранения идентичности объектов или строгой последовательности событий. Классический подход, когда пользователь вводит один промпт, приводит к тому, что модель игнорирует детали: например, вода может протекать сквозь листья, а объекты — исчезать из кадра.
Команда из Принстонского университета и Стэнфорда представила VideoGen-Agent — систему, которая рассматривает генерацию видео как задачу многошагового использования инструментов (tool-use). Агент не просто генерирует кадр, а планирует сцену, проверяет её и корректирует ошибки в реальном времени.
Архитектура: три фазы работы
VideoGen-Agent базируется на модели Qwen3-VL-8B-Instruct и работает по принципу «Reasoning → Action → Observation». Инструменты разделены на три группы:
- Augmentation (Аугментация): Поиск в интернете (Serper), поиск изображений и физическое моделирование (PyBullet) для понимания гравитации и столкновений.
- Generation (Генерация): Использование различных видео-генераторов (T2V, I2V, Motion-to-Video) в зависимости от задачи.
- Verification (Верификация): Использование моделей обнаружения объектов (Grounding DINO) и оценки глубины (Depth Anything V2) для проверки соответствия видео запросу.
Результаты: VABench и сравнение с лидерами
Для оценки была создана специализированная бенчмарк-платформа VABench из 600 промптов, охватывающих шесть категорий: процедурные знания, идентичность одного/нескольких объектов, физика, композиция сцены и многокадровая структура. Агент обучался с помощью многозадачного агентного обучения с подкреплением (GRPO).
Ключевое достижение — значительный прирост качества по сравнению с базовыми моделями. Ниже приведено сравнение результатов на VABench (оценка от 0 до 100, судья Gemini 3.1 Pro):
| Модель | PK | SI | MI | PS | CS | MS | Overall |
|---|---|---|---|---|---|---|---|
| Open-source baselines | |||||||
| CogVideoX-5B | 38.9 | 48.3 | 37.8 | 41.6 | 50.4 | 30.8 | 41.3 |
| Wan 2.1-T2V-14B | 42.0 | 46.2 | 39.5 | 49.5 | 60.8 | 62.0 | 50.0 |
| Commercial baselines | |||||||
| Seedance 1.0 Pro Fast | 55.5 | 51.4 | 44.2 | 46.2 | 74.6 | 66.8 | 56.5 |
| Seedance 2.0 Fast | 78.0 | 75.0 | 69.0 | 60.2 | 87.8 | 68.9 | 73.2 |
| VideoGen-Agent (RL) | |||||||
| Toolset 1 (Seedance 1.0) | 80.4 | 75.1 | 65.3 | 67.9 | 83.1 | 81.7 | 75.6 |
| Toolset 2 (Seedance 2.0) | 92.1 | 83.2 | 86.7 | 69.2 | 90.7 | 94.6 | 86.1 |
Примечание: PK — Procedural Knowledge, SI — Single-Entity Identity, MI — Multi-Entity Identity, PS — Physics Simulation, CS — Compositional Scene, MS — Multi-Shot.
Почему это важно: масштабируемость через агентов
Главное открытие исследователей заключается в том, что VideoGen-Agent не привязан жестко к одной модели генерации. В конфигурации Toolset 2 исследователи заменили базовый генератор Seedance 1.0 на более мощный Seedance 2.0 без дообучения самого агента. Результат? Общий балл вырос с 75.6 до 86.1.
Это доказывает, что обученный агент-координатор может эффективно использовать любые будущие улучшения в области генерации видео. Люди-оценщики предпочитают видео, сгенерированные VideoGen-Agent, в 84.3% случаев по сравнению с сильнейшими изолированными моделями-базовыми линиями.
Бенчмарки
| Бенчмарк | VideoGen-Agent (Toolset 1) | VideoGen-Agent (Toolset 2) | Kling 3.0 | Seedance 2.0 Fast |
|---|---|---|---|---|
| VABench | 75.6% | 86.1% | 65.2% | 73.2% |
Жирным — лучший результат в строке. Источник цифр — официальная публикация.
Источник: Github ↗
