Архитектурный прорыв: DiT и синхронизация
LTX-2 от Lightricks позиционируется как первая DiT-based (Diffusion Transformer) аудио-видео фундаментальная модель. В отличие от предыдущих решений, где аудио и видео генерировались раздельно, LTX-2 объединяет эти процессы в одной системе. Это обеспечивает критически важную синхронизацию речи, движений губ и звукового сопровождения, что делает вывод «production-ready» (готовым к использованию в продакшене).
Модельный ряд и ключевые веса
Основой модели является чекпоинт ltx-2.3-22b-dev.safetensors (22 миллиарда параметров). Для оптимизации инференса и качества доступны специализированные компоненты, включая дистиллированные версии и логические адаптеры (LoRA). Ниже приведена структура доступных весов:
| Компонент | Название файла | Назначение |
|---|---|---|
| Основная модель | ltx-2.3-22b-dev.safetensors | Базовая генерация (22B параметров) |
| Дистиллированная модель | ltx-2.3-22b-distilled-1.1.safetensors | Быстрый инференс (8 шагов) |
| Пространственный апскейлер | ltx-2.3-spatial-upscaler-x2-1.1.safetensors | Увеличение разрешения x2 (для двухэтапного пайплайна) |
| Временной апскейлер | ltx-2.3-temporal-upscaler-x2-1.0.safetensors | Улучшение плавности кадров (будущие реализации) |
| Дистиллированный LoRA | ltx-2.3-22b-distilled-lora-384-1.1.safetensors | Оптимизация для двухэтапных пайплайнов |
Управление камерой и специфические пайплайны
LTX-2 предлагает не только базовый Text-to-Video, но и сложные инструменты контроля. Модель поддерживает IC-LoRA (Instance-Conditioned LoRA) для точного управления:
- Camera Control: Набор LoRA для управления движением камеры (Dolly In/Out/Left/Right, Jib Up/Down, Static).
- Motion & Pose: Контроль трекинга движения и позы персонажей.
- LipDub: Специализированный пайплайн для синхронизации губ с аудио (rephrasing/matching speaker identity).
- HDR: Генерация видео в формате HDR с линейными float-кадрами (LogC3), готовыми для экспорта в EXR и тонмаппинга.
Оптимизация и производительность
Для работы с моделью на разном оборудовании предусмотрены различные стратегии оптимизации:
- DistilledPipeline: Самый быстрый режим, использующий всего 8 предопределенных сигм (8 шагов на первом этапе, 4 на втором).
- FP8 Quantization: Поддержка квантования FP8 для снижения потребления VRAM. Для GPU NVIDIA Hopper рекомендуется использовать
fp8-scaled-mm, для Blackwell (B200) —flash-attn-4==4.0.0b9. - Gradient Estimation: Позволяет сократить количество шагов инференса с 40 до 20–30 без потери качества.
Интеграция и запуск
Модель доступна через GitHub-репозиторий Lightricks. Для быстрого старта требуется установка через uv и загрузка весов с HuggingFace. Также доступна интеграция с ComfyUI через отдельный плагин. Архитектура репозитория монолитна и разделена на пакеты: ltx-core (ядро), ltx-pipelines (инференс) и ltx-trainer (дообучение LoRA и full fine-tuning).
Источник: Github ↗
