Проблема компромисса в генерации
При генерации нескольких изображений по одному промпту пользователи часто сталкиваются с дилеммой: либо получить серию высококачественных, но визуально похожих картинок, либо набор разнообразных, но посредственных по качеству вариантов. Существующие методы либо оптимизируют эти параметры по отдельности, либо смешивают их в один агрегированный балл, что позволяет высоким показателям разнообразия компенсировать низкое качество генерации.
Решение: SatisDive и концепция «Satisficing»
Авторы предлагают подход SatisDive (Satisficing + Diving), который формулирует задачу как поиск решений, удовлетворяющих двум жестким условиям: порог вознаграждения (reward floor) для каждого изображения и порог разнообразия (diversity cutoff) для всего набора. Этот метод работает на этапе инференса и не требует дообучения модели.
Суть метода заключается в разделении кандидатов на две группы. Для изображений с низким вознаграждением алгоритм фокусируется на улучшении качества, а для тех, что уже превысили порог, — на увеличении визуального разнообразия. Изменяя порог вознаграждения, исследователи могут перемещаться по Парето-фронте, находя оптимальный баланс.
Результаты бенчмарков
Эксперименты проводились на базе моделей FLUX.1-dev и SANA-1.6B с использованием метрик HPSv3 и ImageReward. SatisDive демонстрирует статистически значимое превосходство над методом FK steering, особенно в улучшении качества «худшего» кандидата в наборе (worst-candidate reward).
| Модель-основа | Метрика вознаграждения | Улучшение worst-candidate reward (vs FK steering) | Условие сравнения |
|---|---|---|---|
| FLUX.1-dev | HPSv3 | до +0.43 | При совпадении DreamSim |
| SANA-1.6B | ImageReward | до +0.70 | При совпадении DreamSim |
Почему это важно
Метод SatisDive позволяет пользователям и разработчикам не просто «угадывать» параметры генерации, а целенаправленно управлять качеством вывода. Кривые удовлетворенности и разнообразия (satisfaction-diversity curve) метода SatisDive доминируют над аналогами в большинстве сценариев, что делает его мощным инструментом для создания контента, где важны как соответствие запросу, так и вариативность результата.
Источник: arXiv cs.AI ↗
