ModelTC/LightX2V

Легковесная инфраструктура для вывода генерации изображений, видео и действий

Видео⭐ 2 838Pythonпоследний релиз: 0.5.0
Открыть на GitHub ↗Сайт проекта ↗

Что это за инструмент

LightX2V — это легковесный фреймворк для инференса генерации изображений и видео, объединяющий различные SOTA-модели в единую платформу.

Зачем нужен

Инструмент решает задачу эффективного синтеза визуального контента, поддерживая трансформацию разных входных модальностей (текст, изображения) в видео или изображения. Он полезен тем, что позволяет запускать множество моделей (T2V, I2V, T2I, I2I) через единый интерфейс, оптимизируя производительность с помощью квантования (FP8, NVFP4) и дистилляции.

Что можно реализовать

  • Генерация видео из текста (T2V) или изображения (I2V) с использованием моделей Wan 2.2 и LTX 2.3
  • Редактирование изображений (I2I) и генерация изображений по тексту (T2I) в рамках одного пайплайна
  • Развертывание моделей на специфичном железе (T-head PPU, iluvatar, Intel AIPC PTL) с сохранением производительности
  • Использование сильно ускоренных (до 50x) квантованных версий моделей (NVFP4) на GPU уровня RTX 5090
  • Исследование и применение методов disaggregated deployment для обхода ограничений памяти и пропускной способности

Ключевые возможности

  • Поддержка широкого спектра задач: T2V, I2V, T2I, I2I и редактирование изображений
  • Интеграция передовых моделей: Wan 2.2, LTX 2.3, SekoTalk, Qwen-Image, SeedVR2, WorldMirror 2.0
  • Высокая производительность благодаря NVFP4-квантованию и дистилляции (например, 50x ускорение Wan 2.2 на RTX 5090)
  • Поддержка FP8 и NVFP4 квантования для autoregressive video generation моделей (Self Forcing)
  • Наличие онлайн-демо (LightX2V Studio) и готовых Docker-образов для быстрого старта

👤 Кому подойдёт: разработчики, исследователи в области компьютерного зрения, инженеры по машинному обучению, интересующиеся оптимизацией инференса diffusion и autoregressive моделей

Релизы

0.5.0minor
🕐 11 дн назад · релиз на GitHub ↗

Вышла версия 0.5.0 модели LightX2V для эффективного видео- и аудио-генерации.

  • Added: Добавлена эффективная инференс-поддержка для генерации видео из текста.
  • Added: Реализована генерация видео на основе входного изображения (image-to-video).
  • Added: Появилась поддержка совместной генерации видео и аудио из текстового описания.