Релиз модели2 сентября 2026 г., 11:45 МСК🤖 Auto

World Labs представила Atlas: всемогущая модель для 3D и видео

Стартап Фей-Фей Ли выпустил Atlas — первую omni-модель, обученную с нуля на тексте, изображениях, видео и 3D. Она генерирует 1-минутные ролики в 1440p и создает фотореалистичные 3D-сцены из нескольких фото.

Баннер новости 6575

Архитектура нового поколения

World Labs, лаборатория, основанная пионером компьютерного зрения Фей-Фей Ли, представила Atlas — всеобъемлющую (omni) модель мира. В отличие от специализированных нейросетей, Atlas обучена с нуля (pretrained from scratch) на мультимодальных данных: тексте, изображениях, видео и 3D-геометрии. Архитектура представляет собой multimodal autoregressive diffusion transformer, где все входные данные объединяются в единый пространственный контекст. Это позволяет модели не просто генерировать пиксели, а понимать 3D-структуру сцены, сохраняя консистентность объектов при изменении ракурса.

Ключевые возможности и метрики

Atlas демонстрирует прорывные результаты в нескольких задачах, от генерации длинных видео до реконструкции реальных пространств. Модель способна работать с большим количеством входных данных (до сотен изображений) и выдавать результат высокой четкости.

Функция Характеристики и возможности Важность
Генерация видео До 1 минуты, разрешение 1440p, пиксель-перфект контроль камеры Позволяет создавать длинные, кинематографичные сцены без потери качества
Спектр данных Текст, изображения, видео, 3D (точечные облака, Gaussian splats) Универсальность: одна модель заменяет несколько специализированных
3D-реконструкция От 1 до 100+ входных изображений; генерация новых ракурсов Решает проблему синтеза новых видов (Novel View Synthesis) из разреженных данных
Контроль камеры Точная геометрия камеры как нативный тип ввода Режиссерский контроль: можно задать любой путь камеры вручную

Пространственный контекст и 3D-генерация

Уникальная особенность Atlas — работа с пространственным контекстом. Каждая входная картинка привязывается к 3D-координатам. Это позволяет модели «додумывать» невидимые части сцены, основываясь на знаниях о физическом мире. Например, если подать одно фото робота, Atlas сгенерирует его спину и окружающую среду (траву, бассейн), которых не было в исходном кадре. Модель также выдает явные 3D-выходы: точечные облака (point clouds) и 3D Gaussian splats, что критически важно для индустрии игр, VR/AR и робототехники.

Значение для индустрии

Запуск Atlas знаменует переход от генерации отдельных кадров к созданию целостных, симулируемых миров. Модель уже интегрируется в продукты World Labs, такие как Marble. Способность Atlas масштабироваться с увеличением вычислительных мощностей (scaling law) и ее универсальность делают ее мощным инструментом для симуляции реальности, что является ключевым шагом к созданию пространственного интеллекта (spatial intelligence) для роботов и креативных индустрий.

Источник: Orldlabs ↗