Новый подход к Super-Resolution: от шума к структуре
В рамках подготовки к ICML 2026 опубликована реализация метода ASASR (Adversarial Sobolev Alignment for Super-Resolution). В отличие от традиционных подходов, использующих изотропный гауссовский шум, ASASR применяет Colored-Noise Flow — спектрально сформированное ядро, выровненное по естественному многообразию изображений. Это позволяет генератору лучше понимать высокочастотную структуру, используя Riemannian metric (Sobolev frequency-weighted DPO).
Ключевая инновация — Adversarial Manifold Guidance (AMG). Специальная сеть-адверсарий генерирует «трудные негативы» (worst-case hard negatives), которые пространственно выровнены с исходным изображением. Это используется для preference optimization (AS-DPO), заставляя модель избегать типичных артефактов супер-разрешения.
Архитектура и технические детали
Модель построена на базе FLUX.1-dev и использует стратегию dual-LoRA во время инференса:
- SR prior LoRA: базовая модель супер-разрешения, обученная на фреймворке OminiControl.
- DPO refinement LoRA: дообученная через Adversarial Sobolev-DPO для уточнения деталей и подавления шумов.
Обучение проходит в два этапа. Сначала тренируется adversary LoRA (Stage 1), имитирующая артефакты базовых методов (Real-ESRGAN, SeeSR). Затем происходит финальное дообучение FLUX с использованием Sobolev-оператора (реализован через 2D FFT) и двойного батча (global batch size = 512 на 8 GPU).
Метрики и сравнение
ASASR демонстрирует значительное улучшение по сравнению с базовыми методами в задачах масштабирования ×4 (с 128×128 до 512×512). Оценка проводилась на наборах DIV2K и LSDIR с использованием метрик PSNR, SSIM, LPIPS, DISTS, MANIQA, MUSIQ и CLIPIQA+.
| Компонент / Параметр | Значение / Описание | Роль в системе |
|---|---|---|
| Базовая модель | FLUX.1-dev | Генеративное ядро (~24 GB) |
| Масштабирование | ×4 (128px → 512px) | Стандартная задача SR |
| Adversary Strength (λ) | 0.1 | Сила адверсариального возмущения |
| DPO Beta (β) | 2000 (raw 4000) | Параметр предпочтительной оптимизации |
| Sobolev Exponent (S) | 1.5 | Весовой коэффициент высокочастотных структур |
| Размер батча | 512 (8 GPU) | Глобальный размер для стабильности обучения |
Практическое применение и установка
Репозиторий на GitHub предоставляет полный цикл: от подготовки данных (деградация Real-ESRGAN) до инференса. Для работы требуется Python 3.10, PyTorch 2.x и CUDA 11.8/12.x. Весовые коэффициенты (LoRA) хранятся на HuggingFace Hub и весят около 111 МБ каждый, что делает метод легковесным для развертывания.
Метод особенно актуален для задач, где критична структурная верность (structural fidelity) и отсутствие галлюцинаций текстур, что достигается за счет синергии цветного шума и адверсариального обучения.
Источник: Github ↗
