Релиз модели22 сентября 2026 г., 09:46 МСК🤖 Auto

WorldCrafter: ИИ-мир с 3D-памятью, который не забывает увиденное

Исследователи представили WorldCrafter — видео-модель мира с неявной 3D-памятью, обеспечивающую согласованность сцен при длительном исследовании и возврате к ранее увиденным объектам.

Баннер новости 8020

Проблема «потери мира» и решение WorldCrafter

Современные видео-модели мира (video world models) часто страдают от фундаментального недостатка: когда камера отворачивается от объекта, он исчезает из контекста генерации. WorldCrafter решает эту проблему, внедряя камеро-управляемую, неявную 3D-осознанную память. Ключевая идея заключается в том, что запрашиваемая точка обзора определяет, какая историческая информация передается видео-генератору. Совместно обученный энкодер памяти и чтение, обусловленное позой камеры, преобразуют дополняющие друг друга прошлые виды в фиксированный набор токенов памяти, специфичных для целевого вида, без явного оценки глубины или геометрического искажения.

Технические детали и архитектура

Модель работает в трех режимах: от одного изображения, от текстового промпта и через синтез новых видов (Novel View Synthesis) на основе нескольких входных изображений. Память обновляется на основе прошлых кадров, сохраняя пространственную согласованность, в то время как недавний временной контекст поддерживает плавность движения. Архитектура позволяет генерировать непрерывное видео длительностью до нескольких минут, реагируя на управление камерой в реальном времени благодаря дистилляции с малым числом шагов.

Результаты бенчмарков и метрики

WorldCrafter продемонстрировал превосходство над существующими базовыми моделями в задачах долгосрочной согласованности при повторном посещении (long-horizon revisit consistency) и точности управления камерой. Оценка проводилась на обширном наборе данных, включающем 145 сцен и 725 траекторий камеры. Модель достигла наивысшего общего балла по стандарту VBench среди протестированных решений.

Метрика / Характеристика Значение / Результат WorldCrafter Примечание
Общий балл VBench Наивысший среди baselines Сравнение с другими видео-моделями мира
Долгосрочная согласованность Улучшено Возврат к ранее увиденным объектам без артефактов
Точность управления камерой Улучшено Точное следование заданной траектории
Объем тестовых данных 145 сцен, 725 траекторий Статистическая значимость результатов
Режимы ввода Image, Text, Multi-view Поддержка синтеза новых видов

Практическое применение и визуализация

Исследователи подтвердили пространственную согласованность, реконструируя облака точек и траектории камер из сгенерированных видео. Визуализация показывает, что геометрия сцены остается целостной даже при возврате камеры в исходную точку. Это открывает возможности для создания интерактивных виртуальных сред, где пользователь может исследовать статические и динамические сцены, не теряя связи с ранее увиденными элементами.

Источник: Github ↗