Инструменты12 августа 2026 г., 17:45 МСК🤖 Auto

Stable-Layers: RL-оптимизация слоёв изображений без размеченных данных

Stability AI представила Stable-Layers — фреймворк на базе Flow-GRPO и VLM-судьи, улучшающий декомпозицию изображений на слои без использования парных обучающих данных.

Баннер новости 5621

Отказ от парных данных через VLM-судейство

Команда Stability AI представила Stable-Layers — метод дообучения моделей декомпозиции изображений, который устраняет необходимость в парных данных (paired supervision). В основе подхода лежит использование Qwen-Image-Layered в качестве базовой модели, к которой применяется адаптация LoRA и алгоритм Flow-GRPO (Group Relative Policy Optimization).

Ключевая инновация заключается в формировании функции вознаграждения (reward signal) исключительно на основе обратной связи от Vision-Language Model (VLM). Модель генерирует несколько вариантов декомпозиции для каждого изображения, после чего VLM оценивает их качество, а политика оптимизируется на основе относительных преимуществ внутри группы.

Решение проблемы «сжатия» оценок VLM

Основной технической проблемой при использовании VLM в качестве судьи стало то, что при изолированной оценке образцов модели склонны сужать свои оценки в узкий диапазон, что лишает алгоритм GRPO необходимой дисперсии для обучения. Для решения этой проблемы авторы разработали двухэтапный пайплайн оценки:

  • Этап 1: Структурированная оценка каждого образца по пяти критериям, связанным с редактированием изображения.
  • Этап 2: Калибровка на основе сетки (grid-based calibration), где VLM повторно оценивает все кандидаты одновременно, бок о бок, что позволяет выявить реальные различия в качестве.

Количественные улучшения и метрики

Модель Stable-Layers обучалась исключительно на неразмеченных изображениях. Результаты показывают значительное улучшение показателей по сравнению с базовой моделью Qwen-Image-Layered, особенно в части разделения слоев и снижения артефактов. Ниже приведено сравнение средней ошибки реконструкции (L1 error) для различных конфигураций количества слоев (L) и выборок (n).

Конфигурация
L = 2 (n=3 samples) Снижение ошибки по всем слоям, особенно на Pred 0
L = 3 (n=29 samples) Улучшенное выделение семантических элементов, меньше цветового bleed
L = 4 (n=90 samples) Наибольший прирост качества на доминирующем первом слое (Pred 0)

Качественные изменения: чистота масок и отсутствие артефактов

Визуальное сравнение показывает, что базовая модель часто оставляет Layer 0 вырожденным и дублирует композитное изображение в слоях переднего плана. Stable-Layers изолирует различные семантические элементы с помощью более чистых alpha-масок и значительно уменьшает проникновение цвета в прозрачные области.

Метрика Per-Layer Reconstruction Error подтверждает, что Stable-Layers снижает среднюю ошибку реконструкции для всех настроек, обеспечивая наиболее стабильные улучшения на ранних слоях декомпозиции.

Значение для индустрии

Успех Stable-Layers демонстрирует, что сложные задачи компьютерного зрения, такие как декомпозиция изображений, могут быть решены через RLHF-подобные подходы с использованием VLM, избегая дорогостоящего сбора парных данных. Это открывает путь к более гибкому и масштабируемому дообучению моделей генеративного ИИ.

Источник: arXiv preprint arXiv:2605.30257, 2026. Авторы: Ciara Rowles, Reshinth Adithyan, Nikhil Pinnaparaju, Vikram Voleti, Mark Boss.

Источник: Github ↗