Инструменты10 сентября 2026 г., 19:47 МСК🤖 Auto

ComfyUI-VOSR2: Одношаговое улучшение качества изображений с моделью на 1.4B параметров

Появился узел ComfyUI-VOSR2, позволяющий использовать модель суперразрешения VOSR 2.0. Это одношаговая архитектура на 1.4 млрд параметров, сочетающая LightningDiT, VAE Qwen-Image и DINOv2-L для мгновенного апскейла без итераций.

Баннер новости 7192

Техническая суть VOSR 2.0

Новый пакет ComfyUI-VOSR2 от разработчика ylchen333 интегрирует в ComfyUI модель VOSR 2.0. В отличие от традиционных диффузионных моделей, требующих десятков шагов деградации/восстановления, VOSR 2.0 работает в одном шаге. Архитектура весит около 1.4 млрд параметров и состоит из трех жестко связанных компонентов:

  • LightningDiT — диффузионный трансформер, отвечающий за генерацию деталей.
  • Qwen-Image 2D VAE — специализированный вариационный автоэнкодер, обученный в паре с DiT. Его нельзя заменить на стандартные VAE (например, SDXL), так как латентное пространство уникально.
  • DINOv2-L — визуальный энкодер от Meta, обеспечивающий семантическое условие для сохранения структуры оригинала.

Общий размер весов составляет ~7 ГБ. При первом запуске узла VOSR 2.0 Model Loader файлы автоматически загружаются с репозитория CSWRY/VOSR на Hugging Face в директорию ComfyUI/models/vosr2/VOSR2/.

Ключевые параметры и настройки

Модель поддерживает гибкое управление качеством и потреблением VRAM. Важно учитывать, что модель обучалась на патчах до 512 пикселей, поэтому для изображений большего размера необходимо использовать тайлинг (tiling), иначе качество деградирует или возникнет ошибка OOM (Out Of Memory).

Параметр Значение по умолчанию Диапазон / Варианты Примечание
upscale ≥ 1 Без верхнего предела Коэффициент увеличения. Модель обучена на деградациях до 16x, но стабильное качество гарантировано до ~4x.
dtype default fp16, bf16 Для DiT и энкодера. VAE всегда работает в fp32. fp16/bf16 экономят видеопамять.
color_alignment wavelet wavelet, adain, none Метод постобработки для выравнивания цвета с оригиналом. 'wavelet' — рекомендуемый стандарт.
tile_size 4096 512–∞, шаг 64 Размер патча для DiT. Обязательно установите 512, если выходное изображение >512px.
tile_overlap 32 32–512, шаг 8 Перекрытие патчей для DiT.
vae_tile_size 8192 512–∞, шаг 64 Размер патча для декодирования VAE. Рекомендуется 1024 для изображений >1024px, чтобы избежать OOM.

Рекомендуемые настройки для высоких разрешений

Для получения наилучшего результата при апскейле изображений, превышающих 512 пикселей по стороне, разработчики рекомендуют использовать следующие параметры узла VOSR 2.0 Upscale:

  • tile_size: 512
  • tile_overlap: 64
  • vae_tile_size: 1024
  • vae_tile_overlap: 128
  • seed: 42 (или любой другой для вариативности)

Использование тайлинга критично: без него модель может выдать артефакты на границах или не поместиться в видеопамять при декодировании.

Установка и совместимость

Пакет требует актуальную версию ComfyUI (сборки 2025 года и новее, содержащие comfy_api.latest). Установка осуществляется через Git:

cd ComfyUI/custom_nodes
git clone https://github.com/ylchen333/ComfyUI-VOSR2

Зависимости (huggingface_hub, safetensors, einops) уже включены в стандартный стек ComfyUI. Для офлайн-установки или изолированных машин можно вручную скачать файлы из репозитория CSWRY/VOSR и поместить их в структуру models/vosr2/VOSR2/. Обратите внимание: файл энкодера DINOv2-L в репозитории имеет формат PyTorch pickle (.pth), узел автоматически конвертирует его в .safetensors при первом запуске, либо это можно сделать вручную скриптом.

Источник: Github ↗