Прорыв в долгосрочной генерации видео
Лаборатория Alaya Lab представила AlayaWorld — интерактивную авторегрессионную модель мира, которая решает ключевую проблему генеративного видео: потерю согласованности объектов и сцены при длительных роллаутах. В отличие от стандартных видео-моделей, AlayaWorld позволяет пользователю управлять траекторией камеры и менять текстовые промпты прямо в процессе генерации, создавая «играбельные» видеомиры.
Модель поддерживает генерацию чанков длительностью около 1.33 секунды (при 24 fps), что позволяет собирать ролики длительностью до 1 минуты (~45 чанков) без критической деградации качества. Архитектура построена на базе DiT (Diffusion Transformer) с использованием flex_attention в PyTorch ≥ 2.6.
Технические особенности: Память и Стабильность
Ключевое преимущество AlayaWorld — двухуровневая система памяти, обеспечивающая пространственную и временную согласованность:
- Пространственная память: Явный 3D-кэш, который проецируется к запрошенному виду, позволяя модели «вспоминать» объекты, когда камера возвращается к ним.
- Временная память: Сжатая эмбеддинг-история кадров для обеспечения непрерывности сюжета.
- Банк ошибок (Error Bank): Специальный механизм, который переинжектирует накопленные артефакты обратно в память и целевое изображение. Это предотвращает экспоненциальный рост ошибок (error compounding) при длительных генерациях.
Сравнение компонентов и зависимостей
Модель работает как ансамбль из нескольких компонентов. Важно отметить, что веса текстового энкодера и глубинной модели являются сторонними и требуют отдельной загрузки:
| Компонент | Источник / Репозиторий | Статус | Примечание |
|---|---|---|---|
| AlayaWorld Core (DiT + VAE) | AlayaLab/AlayaWorld | Open Source | Файл: merged_infer.safetensors |
| Текстовый энкодер | google/gemma-3-12b-it-qat-q4_0-unquantized | Gated (Hugging Face) | Требуется принятие лицензии Google |
| Depth Model | ByteDance-Seed/Depth-Anything-3 | Open Source | Обязателен для пространственной памяти |
| Текстурный декодер (опц.) | madebyollin/taehv | Open Source | Файл: taeltx2_3_wide.pth |
Требования к железу и запуск
Для инференса требуется CUDA GPU. Модель оптимизирована для работы на одной видеокарте, но поддерживает многокарточное масштабирование через Ulysses context parallel (например, на 2 или 4 GPU). Запуск осуществляется через Python-скрипт с передачей параметров: стартового кадра, траектории камеры (формат cam_c2w [F,4,4]) и текстового промпта.
Лицензия проекта — LTX-2 Community License Agreement. Код и веса доступны для академических и некоммерческих исследований. Для коммерческого использования (компании с доходом ≥ $10 млн) требуется отдельная лицензия от Lightricks Ltd., так как базовая архитектура производна от LTX-2.3.
Источник: Github ↗
