Проблема: отсутствие физического интеллекта у видео-моделей
Объектная постоянство (object permanence) и твердость — ключевые когнитивные приоритеты человека. Несмотря на то, что современные видео-генераторы демонстрируют элементы рассуждения, они часто не способны корректно обрабатывать физические свойства объектов, когда те скрыты от взгляда. Авторы работы из arXiv:2609.28654 задались вопросом: можно ли научить модели мира этому фундаментальному свойству?
Решение: инфраструктура WROP и 1.5 млн сэмплов
Команда представила WROP (World Reasoning with Object Permanence) — специализированную инфраструктуру данных. В нее входят:
- 150 задач, разработанных на основе когнитивной науки, разделенных на 6 категорий.
- Генераторы Blender, которые рандомизируют скорость, освещение, угол камеры и другие параметры, сохраняя при этом когнитивную структуру задачи.
- Корпус из 1.5 млн образцов (по 10 000+ на задачу) и экзаменационный набор из 300 вопросов.
Результаты: PWM-WROP против 13 конкурентов
На экзамене WROP оценили 14 видео-моделей, включая 3 reference-to-video, 7 edit и 4 continuation-модели. Разработанная авторами PWM-WROP (16B параметров) показала выдающиеся результаты. В слепом парном Elo-тесте она заняла 1-е место среди моделей-продолжателей (continuation) и 3-е место в общем зачете, уступив лишь статистически равнозначной паре reference-to-video моделей.
| Модель / Категория | Позиция в Elo-тесте | Примечание |
|---|---|---|
| Reference-to-video (Model A) | 1-2 (победитель) | Статистическое ничейное преимущество |
| Reference-to-video (Model B) | 1-2 (победитель) | Статистическое ничейное преимущество |
| PWM-WROP (16B) | 3-е место | Лучшая среди continuation-моделей |
| Другие 11 моделей | 4-14 | Включая 7 edit и 3 continuation |
Открытость и инструменты
Авторы опубликовали не только данные и веса модели, но и ответы с оценками. Также доступен стек обучения PWM на базе Native PyTorch, оптимизированный для AWS Trainium2, что позволяет исследователям воспроизвести результаты и развивать направление физического интеллекта в генеративных моделях.
Источник: arXiv cs.AI ↗
