Проблема «потери мира» и решение WorldCrafter
Современные видео-модели мира (video world models) часто страдают от фундаментального недостатка: когда камера отворачивается от объекта, он исчезает из контекста генерации. WorldCrafter решает эту проблему, внедряя камеро-управляемую, неявную 3D-осознанную память. Ключевая идея заключается в том, что запрашиваемая точка обзора определяет, какая историческая информация передается видео-генератору. Совместно обученный энкодер памяти и чтение, обусловленное позой камеры, преобразуют дополняющие друг друга прошлые виды в фиксированный набор токенов памяти, специфичных для целевого вида, без явного оценки глубины или геометрического искажения.
Технические детали и архитектура
Модель работает в трех режимах: от одного изображения, от текстового промпта и через синтез новых видов (Novel View Synthesis) на основе нескольких входных изображений. Память обновляется на основе прошлых кадров, сохраняя пространственную согласованность, в то время как недавний временной контекст поддерживает плавность движения. Архитектура позволяет генерировать непрерывное видео длительностью до нескольких минут, реагируя на управление камерой в реальном времени благодаря дистилляции с малым числом шагов.
Результаты бенчмарков и метрики
WorldCrafter продемонстрировал превосходство над существующими базовыми моделями в задачах долгосрочной согласованности при повторном посещении (long-horizon revisit consistency) и точности управления камерой. Оценка проводилась на обширном наборе данных, включающем 145 сцен и 725 траекторий камеры. Модель достигла наивысшего общего балла по стандарту VBench среди протестированных решений.
| Метрика / Характеристика | Значение / Результат WorldCrafter | Примечание |
|---|---|---|
| Общий балл VBench | Наивысший среди baselines | Сравнение с другими видео-моделями мира |
| Долгосрочная согласованность | Улучшено | Возврат к ранее увиденным объектам без артефактов |
| Точность управления камерой | Улучшено | Точное следование заданной траектории |
| Объем тестовых данных | 145 сцен, 725 траекторий | Статистическая значимость результатов |
| Режимы ввода | Image, Text, Multi-view | Поддержка синтеза новых видов |
Практическое применение и визуализация
Исследователи подтвердили пространственную согласованность, реконструируя облака точек и траектории камер из сгенерированных видео. Визуализация показывает, что геометрия сцены остается целостной даже при возврате камеры в исходную точку. Это открывает возможности для создания интерактивных виртуальных сред, где пользователь может исследовать статические и динамические сцены, не теряя связи с ранее увиденными элементами.
Источник: Github ↗
