Проблема: от 2D-видео к 3D-геометрии
Современные модели предсказания мира (World Models) часто ограничиваются генерацией 2D-видео, где агент лишь «смотрит» на будущие кадры. Однако для создания полноценных игр требуется не просто визуализация, а постоянная 3D-геометрия, поддерживающая перемещение и взаимодействие. В отличие от робототехники, где физический мир существует независимо от модели, в играх виртуальное пространство должно быть сгенерировано и «зафиксировано» самой системой.
Решение: Valerant и SLAM
Команда авторов (Yiran Qiao, Feng Wang, Jing Ma) предложила фреймворк Valerant, который трансформирует предобученную Action-Conditioned World Model в инструмент для исследования и построения карт. Ключевая инновация — интеграция методов SLAM (Simultaneous Localization and Mapping) с предсказательными визуальными роллаутами. Это позволяет системе не только предсказывать, что увидит агент, но и конвертировать эти данные в пространственное представление, постепенно строя карту из одиночного начального изображения.
Технические детали
Valerant работает в режиме training-free (без дообучения), используя уже существующие модели для генерации действий и предсказания состояний. Архитектура решает две задачи одновременно:
- Exploration-driven action selection: Выбор действий на основе необходимости исследовать неизвестные области.
- Spatial reconstruction: Построение навигируемого 3D-окружения на основе визуальных наблюдений.
Значение для индустрии
Подход открывает путь к автоматизации создания игровых уровней, снижая зависимость от ручного моделирования. Если ранее World Models использовались в основном для симуляции поведения в 2D-пространствах, то Valerant демонстрирует, как эти модели могут инстанцировать (создавать) саму игровую среду, делая её пригодной для использования в реальных 3D-играх.
Источник: arXiv cs.AI ↗
