Проблема «потери» объектов в видео-моделях
Современные видео-модели мира (World Models) часто страдают от критического недостатка: они являются «агент-центричными». Как только объект покидает поле зрения главного персонажа (агента), модель теряет о нем информацию. При повторном появлении объекта в кадре существующие решения (DreamX-World, FantasyWorld, HY-World 1.5 и др.) часто выдают артефакты, «замораживают» объект или генерируют его неверно (эффект «имитатора»).
Команда KAIST AI предлагает решение — World Observer. Архитектура использует единый DiT (Diffusion Transformer) для совместной генерации двух потоков: перспективного вида агента и панорамного вида наблюдателя. Это позволяет объектам продолжать эволюцию в «незримой» зоне, пока они скрыты от агента.
Ключевые технические инновации
Модель решает проблему непрерывности мира через три механизма:
- Joint Actor-Observer Modeling: Объекты, выходящие из вида агента, продолжают двигаться в панорамном потоке наблюдателя. Оба потока разделяют единое состояние мира.
- Panoramic Warping: Геометрия камеры согласуется через общую панораму, что фиксирует пространственные отношения между агентами и наблюдателями.
- Observer Sink: Специальный модуль высокой четкости, который восстанавливает мелкие детали объекта, когда он снова входит в поле зрения агента, обращаясь к «памяти» наблюдателя.
Сравнение с состоянием искусства (SOTA)
В ходе тестирования на реальных и синтетических (CARLA) сценах World Observer демонстрирует превосходство в сохранении идентичности объектов. Ниже приведено качественное сравнение поведения моделей, когда объект (например, человек с чемоданами или грузовик) выходит из кадра и возвращается:
| Модель | Поведение при выходе из вида | Поведение при возвращении в кадр |
|---|---|---|
| World Observer (Ours) | Объект продолжает движение в панораме наблюдателя | Возвращается с сохранением динамики и внешнего вида |
| DreamX-World | Часто теряет контекст | Артефакты, искажение формы или «застывание» |
| FantasyWorld | Потеря связи с объектом | Генерация нового, похожего объекта (impostor) |
| HY-World 1.5 | Неполное отслеживание | Нарушение физики движения |
| HyDRA | Зависит от текущего кадра | Резкая смена состояния без плавного перехода |
| LingBot-World | Ограниченная память | Потеря мелких деталей |
| Matrix-Game 3 | — | — |
| OmniRoam | — | — |
| PanoWorld | — | — |
Гибкое управление и множественные наблюдатели
Отделение наблюдателя от агента дает новые возможности контроля. Пользователь может:
- Размещать наблюдателей в любой точке: Не обязательно привязывать камеру к персонажу. Можно следить за коридором, пока персонаж находится в другой комнате.
- Использовать множественных наблюдателей: Одновременное отслеживание нескольких зон (Multi-Observer) для полного покрытия сцены.
- Управлять скрытым миром: Текстовые промпты можно направлять непосредственно на наблюдателя, заставляя события происходить за пределами видимости агента (например, «Санта-Клаус входит из коридора и садится в кресло», даже если агент смотрит в другую сторону).
Данные и обучение
Модель обучена на синхронизированных видео, включающих:
- Реальные панорамные видео: Где наблюдатель движется вместе с агентом.
- Синтетические данные CARLA: Где наблюдатели размещены независимо от агента, а также сценарии с несколькими наблюдателями одновременно.
Абляционные исследования показывают, что удаление модуля Observer Sink приводит к потере мелких деталей при больших изменениях ракурса, а отсутствие самого наблюдателя — к полной потере динамики скрытых объектов.
Источник: Github ↗
