Релиз модели1 июля 2026 г., 13:45 МСК🤖 Auto

ASASR: ИИ-сверхразрешение на FLUX.1 с подавлением артефактов

Команда исследователей представила ASASR — метод сверхразрешения изображений на базе FLUX.1, использующий adversarial Sobolev alignment для устранения галлюцинаций и повышения структурной точности.

Баннер новости 2728

Новый подход к Super-Resolution: от шума к структуре

В рамках подготовки к ICML 2026 опубликована реализация метода ASASR (Adversarial Sobolev Alignment for Super-Resolution). В отличие от традиционных подходов, использующих изотропный гауссовский шум, ASASR применяет Colored-Noise Flow — спектрально сформированное ядро, выровненное по естественному многообразию изображений. Это позволяет генератору лучше понимать высокочастотную структуру, используя Riemannian metric (Sobolev frequency-weighted DPO).

Ключевая инновация — Adversarial Manifold Guidance (AMG). Специальная сеть-адверсарий генерирует «трудные негативы» (worst-case hard negatives), которые пространственно выровнены с исходным изображением. Это используется для preference optimization (AS-DPO), заставляя модель избегать типичных артефактов супер-разрешения.

Архитектура и технические детали

Модель построена на базе FLUX.1-dev и использует стратегию dual-LoRA во время инференса:

  • SR prior LoRA: базовая модель супер-разрешения, обученная на фреймворке OminiControl.
  • DPO refinement LoRA: дообученная через Adversarial Sobolev-DPO для уточнения деталей и подавления шумов.

Обучение проходит в два этапа. Сначала тренируется adversary LoRA (Stage 1), имитирующая артефакты базовых методов (Real-ESRGAN, SeeSR). Затем происходит финальное дообучение FLUX с использованием Sobolev-оператора (реализован через 2D FFT) и двойного батча (global batch size = 512 на 8 GPU).

Метрики и сравнение

ASASR демонстрирует значительное улучшение по сравнению с базовыми методами в задачах масштабирования ×4 (с 128×128 до 512×512). Оценка проводилась на наборах DIV2K и LSDIR с использованием метрик PSNR, SSIM, LPIPS, DISTS, MANIQA, MUSIQ и CLIPIQA+.

Компонент / Параметр Значение / Описание Роль в системе
Базовая модель FLUX.1-dev Генеративное ядро (~24 GB)
Масштабирование ×4 (128px → 512px) Стандартная задача SR
Adversary Strength (λ) 0.1 Сила адверсариального возмущения
DPO Beta (β) 2000 (raw 4000) Параметр предпочтительной оптимизации
Sobolev Exponent (S) 1.5 Весовой коэффициент высокочастотных структур
Размер батча 512 (8 GPU) Глобальный размер для стабильности обучения

Практическое применение и установка

Репозиторий на GitHub предоставляет полный цикл: от подготовки данных (деградация Real-ESRGAN) до инференса. Для работы требуется Python 3.10, PyTorch 2.x и CUDA 11.8/12.x. Весовые коэффициенты (LoRA) хранятся на HuggingFace Hub и весят около 111 МБ каждый, что делает метод легковесным для развертывания.

Метод особенно актуален для задач, где критична структурная верность (structural fidelity) и отсутствие галлюцинаций текстур, что достигается за счет синергии цветного шума и адверсариального обучения.

Источник: Github ↗