Проблема «доброжелательной враждебности»
С развитием текстовых моделей генерации изображений (text-to-image) растет риск создания контента, не подходящего для работы (NSFW), включая насилие и непристойности. Существующие методы защиты часто требуют белого доступа к модели (white-box), что делает их неприменимыми к проприетарным системам. Альтернативы на базе LLM для переписывания промптов не справляются с так называемой «доброжелательной враждебной» (benign adversarial) проблемой: промпты, которые лингвистически безопасны, но из-за обученного распределения данных модели все равно генерируют вредоносный контент.
Решение: DiSCO как плагин-защита
Исследователи предложили DiSCO (Distribution-guided Contrastive Prompt Optimization) — метод защиты нулевого дня (zero-shot), работающий строго в режиме черного ящика. DiSCO не требует переобучения, тонкой настройки или доступа к внутренностям модели. Он действует как модуль «plug-and-play», оперируя исключительно на уровне промптов. Метод использует beam search для расширения суффиксов промпта и контрастную оценку, сравнивая пулы безопасных и небезопасных изображений, сгенерированных целевой моделью, с итеративной обратной связью до получения безопасного результата.
Результаты на бенчмарке I2P
Эксперименты показали, что DiSCO последовательно повышает безопасность как undefended (без защиты), так и defended (с защитой) моделей. Ниже приведены ключевые метрики снижения ASR (Attack Success Rate) при различных атаках red-teaming:
| Состояние модели | Снижение ASR (DiSCO) | Ключевое преимущество |
|---|---|---|
| Undefended (без защиты) | 37.7% | Сохранение семантической точности |
| Defended (с защитой) | 25.13% | Улучшение связности изображений |
Почему это важно
DiSCO демонстрирует, что эффективная защита от вредоносных промптов возможна без вмешательства в архитектуру модели. Это открывает путь к внедрению таких защит в коммерческие API и проприетарные системы, где доступ к весам закрыт. Кроме того, метод не только блокирует вредоносный контент, но и улучшает семантическую верность и связность генерируемых изображений, что критично для качества конечного продукта.
Источник: arXiv cs.AI ↗
