Релиз модели3 октября 2026 г., 13:45 МСК🤖 Auto

World Observer: AI-модель, помнящая объекты за пределами кадра

Исследователи из KAIST представили World Observer — архитектуру, которая разделяет роли агента и наблюдателя, позволяя модели отслеживать объекты, покинувшие поле зрения, и сохранять их состояние при возвращении.

Баннер новости 8846

Проблема «потери» объектов в видео-моделях

Современные видео-модели мира (World Models) часто страдают от критического недостатка: они являются «агент-центричными». Как только объект покидает поле зрения главного персонажа (агента), модель теряет о нем информацию. При повторном появлении объекта в кадре существующие решения (DreamX-World, FantasyWorld, HY-World 1.5 и др.) часто выдают артефакты, «замораживают» объект или генерируют его неверно (эффект «имитатора»).

Команда KAIST AI предлагает решение — World Observer. Архитектура использует единый DiT (Diffusion Transformer) для совместной генерации двух потоков: перспективного вида агента и панорамного вида наблюдателя. Это позволяет объектам продолжать эволюцию в «незримой» зоне, пока они скрыты от агента.

Ключевые технические инновации

Модель решает проблему непрерывности мира через три механизма:

  • Joint Actor-Observer Modeling: Объекты, выходящие из вида агента, продолжают двигаться в панорамном потоке наблюдателя. Оба потока разделяют единое состояние мира.
  • Panoramic Warping: Геометрия камеры согласуется через общую панораму, что фиксирует пространственные отношения между агентами и наблюдателями.
  • Observer Sink: Специальный модуль высокой четкости, который восстанавливает мелкие детали объекта, когда он снова входит в поле зрения агента, обращаясь к «памяти» наблюдателя.

Сравнение с состоянием искусства (SOTA)

В ходе тестирования на реальных и синтетических (CARLA) сценах World Observer демонстрирует превосходство в сохранении идентичности объектов. Ниже приведено качественное сравнение поведения моделей, когда объект (например, человек с чемоданами или грузовик) выходит из кадра и возвращается:

Модель Поведение при выходе из вида Поведение при возвращении в кадр
World Observer (Ours) Объект продолжает движение в панораме наблюдателя Возвращается с сохранением динамики и внешнего вида
DreamX-World Часто теряет контекст Артефакты, искажение формы или «застывание»
FantasyWorld Потеря связи с объектом Генерация нового, похожего объекта (impostor)
HY-World 1.5 Неполное отслеживание Нарушение физики движения
HyDRA Зависит от текущего кадра Резкая смена состояния без плавного перехода
LingBot-World Ограниченная память Потеря мелких деталей
Matrix-Game 3 — —
OmniRoam — —
PanoWorld — —

Гибкое управление и множественные наблюдатели

Отделение наблюдателя от агента дает новые возможности контроля. Пользователь может:

  1. Размещать наблюдателей в любой точке: Не обязательно привязывать камеру к персонажу. Можно следить за коридором, пока персонаж находится в другой комнате.
  2. Использовать множественных наблюдателей: Одновременное отслеживание нескольких зон (Multi-Observer) для полного покрытия сцены.
  3. Управлять скрытым миром: Текстовые промпты можно направлять непосредственно на наблюдателя, заставляя события происходить за пределами видимости агента (например, «Санта-Клаус входит из коридора и садится в кресло», даже если агент смотрит в другую сторону).

Данные и обучение

Модель обучена на синхронизированных видео, включающих:

  • Реальные панорамные видео: Где наблюдатель движется вместе с агентом.
  • Синтетические данные CARLA: Где наблюдатели размещены независимо от агента, а также сценарии с несколькими наблюдателями одновременно.

Абляционные исследования показывают, что удаление модуля Observer Sink приводит к потере мелких деталей при больших изменениях ракурса, а отсутствие самого наблюдателя — к полной потере динамики скрытых объектов.

Источник: Github ↗