Проблема неявного состояния в видео-моделях
Современные видео-генеративные модели (World Models) часто работают как «черные ящики»: их внутреннее состояние скрыто в визуальной истории кадров. Это приводит к критическим ограничениям — объекты, ушедшие за пределы кадра, забываются; логические правила (здоровье, отношения, физика) не могут быть проверены или отредактированы; а управление ограничивается только камерой и текстовыми промптами. Алгоритмическая логика отсутствует, что делает невозможным создание стабильных интерактивных симуляций.
Архитектура PWM: Разделение логики и рендера
Programmable World Model решает эту проблему через явное разделение процессов. Система состоит из четырех ключевых компонентов:
- State Executor (Исполнитель состояния): Поддерживает и обновляет каноническое состояние мира на основе действий игрока и заданных правил.
- Deterministic Compiler (Детерминированный компилятор): Проецирует состояние мира, представленное в виде 3D OBB (Oriented Bounding Boxes), в пиксельно-выровненные управляющие сигналы.
- Video Model (Видео-модель): Генерирует визуальное наблюдение на основе управляющих сигналов.
- VLM-based Agent (Агент на базе VLM): Создает исполняемую спецификацию мира на основе референсного изображения и текстового описания.
Ключевые возможности и метрики
Внедрение явного состояния позволяет реализовать функции, недоступные стандартным видео-моделям. Ниже приведены сравнительные характеристики подхода PWM:
| Характеристика | Стандартные World Models | Programmable World Model (PWM) |
|---|---|---|
| Хранение состояния | Неявное (в скрытых слоях) | Явное (структурированные записи, код) |
| Off-screen Persistence | Объекты забываются за кадром | Сущности существуют и обновляются за пределами видимости |
| Управление логикой | Только через промпты | Через триггеры событий и правила (Event Triggers) |
| Стабильность (Long Horizon) | Дрейф состояния, противоречия | Отсутствие дрейфа (проверено на 897 кадрах) |
Практические примеры: От джунглей до арктики
В демонстрациях PWM показано, как система обрабатывает сложные сценарии. Например, в сцене с тремя минотаврами в туманном лесу система точно отслеживает количество живых врагов (2/3), применяя событие «смерть» к каноническому состоянию, а не просто меняя картинку. При панорамировании камеры на -130° выявляются сущности, которые существовали в состоянии мира, но находились за кадром.
В другом тесте на военном аэродроме автомобиль въезжает в сцену и останавливается строго в соответствии с логикой программы, а карта направлений отделяет движение сущности от движения камеры. Система успешно генерирует 30-секундные авторегрессионные ролики (897 кадров) с толпой сущностей, где каждый персонаж действует в соответствии с заданными правилами без визуального «дрейфа».
Значение для индустрии
Alaya Lab демонстрирует, что видео-генерация может стать полноценным «движком мира», а не просто инструментом создания контента. Возможность писать исполняемые спецификации для мира открывает путь к созданию интерактивных симуляций, игр и образовательных сред с гарантированной логической целостностью, где визуальная часть является лишь интерфейсом для сложной алгоритмической базы.
Источник: Github ↗
