Оптимизация для слабых GPU
Команда RealRebelAI представила репак весов модели robbyant/lingbot-video-dense-1.3b, специально адаптированный для работы в среде ComfyUI. Ключевое отличие — архитектура, позволяющая запускать генерацию видео (T2V и TI2V) на видеокартах уровня NVIDIA RTX 3070 с 8 ГБ VRAM. Модель использует подход, при котором тяжелый текстовый энкодер Qwen3-VL загружается в оперативную память (CPU), обрабатывает запрос и освобождается, прежде чем в видеопамять будет загружен сам диффузионный трансформер (DiT) объемом 2.79 ГБ в формате bf16.
Технические характеристики и производительность
Модель демонстрирует впечатляющую скорость для своего класса. На конфигурации RTX 3070 (16 ГБ RAM) генерация одного шага занимает около 14 секунд. Полная генерация клипа максимальной длины (81 кадр) занимает примерно 10 минут. Модель поддерживает разрешение 832×480 и до 81 кадра при 40 шагах генерации.
| Параметр | Значение / Описание |
|---|---|
| Модель | LingBot-Video-Dense-1.3B (DiT) |
| Текстовый энкодер | Qwen3-VL (загружается на CPU) |
| Размер DiT | ~2.8 GB (safetensors) |
| Размер VAE | ~0.5 GB (safetensors) |
| Размер текстового энкодера | ~8 GB (safetensors) |
| Рекомендуемое разрешение | 832×480 |
| Макс. кадров | 81 |
| Скорость (RTX 3070) | ~14 сек/итерация, ~10 мин за клип |
Ограничения и настройки
Пользователям следует учитывать ряд технических ограничений. Модель обучалась на окне в 81 кадр, поэтому попытки сгенерировать более длинные последовательности приводят к деградации качества. Соотношение сторон 832×480 является оптимальным; использование квадратных изображений или других пропорций вызывает артефакты (letterboxing). Также модель не предназначена для рендеринга читаемого текста (надписи, таблички будут нечеткими) и обладает умеренной сложностью движения.
Инструкция по установке
Для работы требуется пакет нод ComfyUI_Rebels_LingBot. Файлы весов необходимо разместить в соответствующих папках ComfyUI:
- LingBot_1.3b_DiT.safetensors →
ComfyUI/models/diffusion_models/ - LingBot_text-encoder.safetensors →
ComfyUI/models/text_encoders/ - LingBot_vae.safetensors →
ComfyUI/models/vae/
Для режима Text-to-Image (TI2V) изображение необходимо подавать как на узел кодирования (vision conditioning), так и на самплер (как латент первого кадра). Лицензия весов наследует условия upstream-репозитория, что требует проверки перед коммерческим использованием.
Источник: Huggingface ↗
