Релиз модели4 июля 2026 г., 21:46 МСК🤖 Auto

LTX-2: Первая DiT-модель с синхронным аудио и видео

Lightricks представила LTX-2 — первую модель на архитектуре DiT, генерирующую видео и звук в едином контуре. Модель обеспечивает точную синхронизацию речи, движения и аудио, предлагая открытые веса и API.

Баннер новости 2909

Архитектурный прорыв: DiT и синхронизация

LTX-2 от Lightricks позиционируется как первая DiT-based (Diffusion Transformer) аудио-видео фундаментальная модель. В отличие от предыдущих решений, где аудио и видео генерировались раздельно, LTX-2 объединяет эти процессы в одной системе. Это обеспечивает критически важную синхронизацию речи, движений губ и звукового сопровождения, что делает вывод «production-ready» (готовым к использованию в продакшене).

Модельный ряд и ключевые веса

Основой модели является чекпоинт ltx-2.3-22b-dev.safetensors (22 миллиарда параметров). Для оптимизации инференса и качества доступны специализированные компоненты, включая дистиллированные версии и логические адаптеры (LoRA). Ниже приведена структура доступных весов:

Компонент Название файла Назначение
Основная модель ltx-2.3-22b-dev.safetensors Базовая генерация (22B параметров)
Дистиллированная модель ltx-2.3-22b-distilled-1.1.safetensors Быстрый инференс (8 шагов)
Пространственный апскейлер ltx-2.3-spatial-upscaler-x2-1.1.safetensors Увеличение разрешения x2 (для двухэтапного пайплайна)
Временной апскейлер ltx-2.3-temporal-upscaler-x2-1.0.safetensors Улучшение плавности кадров (будущие реализации)
Дистиллированный LoRA ltx-2.3-22b-distilled-lora-384-1.1.safetensors Оптимизация для двухэтапных пайплайнов

Управление камерой и специфические пайплайны

LTX-2 предлагает не только базовый Text-to-Video, но и сложные инструменты контроля. Модель поддерживает IC-LoRA (Instance-Conditioned LoRA) для точного управления:

  • Camera Control: Набор LoRA для управления движением камеры (Dolly In/Out/Left/Right, Jib Up/Down, Static).
  • Motion & Pose: Контроль трекинга движения и позы персонажей.
  • LipDub: Специализированный пайплайн для синхронизации губ с аудио (rephrasing/matching speaker identity).
  • HDR: Генерация видео в формате HDR с линейными float-кадрами (LogC3), готовыми для экспорта в EXR и тонмаппинга.

Оптимизация и производительность

Для работы с моделью на разном оборудовании предусмотрены различные стратегии оптимизации:

  • DistilledPipeline: Самый быстрый режим, использующий всего 8 предопределенных сигм (8 шагов на первом этапе, 4 на втором).
  • FP8 Quantization: Поддержка квантования FP8 для снижения потребления VRAM. Для GPU NVIDIA Hopper рекомендуется использовать fp8-scaled-mm, для Blackwell (B200) — flash-attn-4==4.0.0b9.
  • Gradient Estimation: Позволяет сократить количество шагов инференса с 40 до 20–30 без потери качества.

Интеграция и запуск

Модель доступна через GitHub-репозиторий Lightricks. Для быстрого старта требуется установка через uv и загрузка весов с HuggingFace. Также доступна интеграция с ComfyUI через отдельный плагин. Архитектура репозитория монолитна и разделена на пакеты: ltx-core (ядро), ltx-pipelines (инференс) и ltx-trainer (дообучение LoRA и full fine-tuning).

Источник: Github ↗