Релиз модели24 июля 2026 г., 19:47 МСК🤖 Auto

AlayaWorld: Интерактивный генератор миров с памятью и управлением камерой

Alaya Lab выпустила open-source модель AlayaWorld, способную генерировать видео до 1 минуты с сохранением пространственной согласованности и возможностью управления камерой в реальном времени.

Баннер новости 4316

Прорыв в долгосрочной генерации видео

Лаборатория Alaya Lab представила AlayaWorld — интерактивную авторегрессионную модель мира, которая решает ключевую проблему генеративного видео: потерю согласованности объектов и сцены при длительных роллаутах. В отличие от стандартных видео-моделей, AlayaWorld позволяет пользователю управлять траекторией камеры и менять текстовые промпты прямо в процессе генерации, создавая «играбельные» видеомиры.

Модель поддерживает генерацию чанков длительностью около 1.33 секунды (при 24 fps), что позволяет собирать ролики длительностью до 1 минуты (~45 чанков) без критической деградации качества. Архитектура построена на базе DiT (Diffusion Transformer) с использованием flex_attention в PyTorch ≥ 2.6.

Технические особенности: Память и Стабильность

Ключевое преимущество AlayaWorld — двухуровневая система памяти, обеспечивающая пространственную и временную согласованность:

  • Пространственная память: Явный 3D-кэш, который проецируется к запрошенному виду, позволяя модели «вспоминать» объекты, когда камера возвращается к ним.
  • Временная память: Сжатая эмбеддинг-история кадров для обеспечения непрерывности сюжета.
  • Банк ошибок (Error Bank): Специальный механизм, который переинжектирует накопленные артефакты обратно в память и целевое изображение. Это предотвращает экспоненциальный рост ошибок (error compounding) при длительных генерациях.

Сравнение компонентов и зависимостей

Модель работает как ансамбль из нескольких компонентов. Важно отметить, что веса текстового энкодера и глубинной модели являются сторонними и требуют отдельной загрузки:

Компонент Источник / Репозиторий Статус Примечание
AlayaWorld Core (DiT + VAE) AlayaLab/AlayaWorld Open Source Файл: merged_infer.safetensors
Текстовый энкодер google/gemma-3-12b-it-qat-q4_0-unquantized Gated (Hugging Face) Требуется принятие лицензии Google
Depth Model ByteDance-Seed/Depth-Anything-3 Open Source Обязателен для пространственной памяти
Текстурный декодер (опц.) madebyollin/taehv Open Source Файл: taeltx2_3_wide.pth

Требования к железу и запуск

Для инференса требуется CUDA GPU. Модель оптимизирована для работы на одной видеокарте, но поддерживает многокарточное масштабирование через Ulysses context parallel (например, на 2 или 4 GPU). Запуск осуществляется через Python-скрипт с передачей параметров: стартового кадра, траектории камеры (формат cam_c2w [F,4,4]) и текстового промпта.

Лицензия проекта — LTX-2 Community License Agreement. Код и веса доступны для академических и некоммерческих исследований. Для коммерческого использования (компании с доходом ≥ $10 млн) требуется отдельная лицензия от Lightricks Ltd., так как базовая архитектура производна от LTX-2.3.

Источник: Github ↗