Отказ от парных данных через VLM-судейство
Команда Stability AI представила Stable-Layers — метод дообучения моделей декомпозиции изображений, который устраняет необходимость в парных данных (paired supervision). В основе подхода лежит использование Qwen-Image-Layered в качестве базовой модели, к которой применяется адаптация LoRA и алгоритм Flow-GRPO (Group Relative Policy Optimization).
Ключевая инновация заключается в формировании функции вознаграждения (reward signal) исключительно на основе обратной связи от Vision-Language Model (VLM). Модель генерирует несколько вариантов декомпозиции для каждого изображения, после чего VLM оценивает их качество, а политика оптимизируется на основе относительных преимуществ внутри группы.
Решение проблемы «сжатия» оценок VLM
Основной технической проблемой при использовании VLM в качестве судьи стало то, что при изолированной оценке образцов модели склонны сужать свои оценки в узкий диапазон, что лишает алгоритм GRPO необходимой дисперсии для обучения. Для решения этой проблемы авторы разработали двухэтапный пайплайн оценки:
- Этап 1: Структурированная оценка каждого образца по пяти критериям, связанным с редактированием изображения.
- Этап 2: Калибровка на основе сетки (grid-based calibration), где VLM повторно оценивает все кандидаты одновременно, бок о бок, что позволяет выявить реальные различия в качестве.
Количественные улучшения и метрики
Модель Stable-Layers обучалась исключительно на неразмеченных изображениях. Результаты показывают значительное улучшение показателей по сравнению с базовой моделью Qwen-Image-Layered, особенно в части разделения слоев и снижения артефактов. Ниже приведено сравнение средней ошибки реконструкции (L1 error) для различных конфигураций количества слоев (L) и выборок (n).
| Конфигурация | |
|---|---|
| L = 2 (n=3 samples) | Снижение ошибки по всем слоям, особенно на Pred 0 |
| L = 3 (n=29 samples) | Улучшенное выделение семантических элементов, меньше цветового bleed |
| L = 4 (n=90 samples) | Наибольший прирост качества на доминирующем первом слое (Pred 0) |
Качественные изменения: чистота масок и отсутствие артефактов
Визуальное сравнение показывает, что базовая модель часто оставляет Layer 0 вырожденным и дублирует композитное изображение в слоях переднего плана. Stable-Layers изолирует различные семантические элементы с помощью более чистых alpha-масок и значительно уменьшает проникновение цвета в прозрачные области.
Метрика Per-Layer Reconstruction Error подтверждает, что Stable-Layers снижает среднюю ошибку реконструкции для всех настроек, обеспечивая наиболее стабильные улучшения на ранних слоях декомпозиции.
Значение для индустрии
Успех Stable-Layers демонстрирует, что сложные задачи компьютерного зрения, такие как декомпозиция изображений, могут быть решены через RLHF-подобные подходы с использованием VLM, избегая дорогостоящего сбора парных данных. Это открывает путь к более гибкому и масштабируемому дообучению моделей генеративного ИИ.
Источник: arXiv preprint arXiv:2605.30257, 2026. Авторы: Ciara Rowles, Reshinth Adithyan, Nikhil Pinnaparaju, Vikram Voleti, Mark Boss.
Источник: Github ↗
