Исследования19 августа 2026 г., 08:18 МСК🤖 Auto

DiSCO: Черный ящик спасает генерацию изображений от NSFW

Новый метод DiSCO защищает текстовые модели генерации изображений от вредоносных промптов без доступа к весам, снижая вероятность генерации NSFW на 37,7%.

Баннер новости 6047

Проблема «доброжелательной враждебности»

С развитием текстовых моделей генерации изображений (text-to-image) растет риск создания контента, не подходящего для работы (NSFW), включая насилие и непристойности. Существующие методы защиты часто требуют белого доступа к модели (white-box), что делает их неприменимыми к проприетарным системам. Альтернативы на базе LLM для переписывания промптов не справляются с так называемой «доброжелательной враждебной» (benign adversarial) проблемой: промпты, которые лингвистически безопасны, но из-за обученного распределения данных модели все равно генерируют вредоносный контент.

Решение: DiSCO как плагин-защита

Исследователи предложили DiSCO (Distribution-guided Contrastive Prompt Optimization) — метод защиты нулевого дня (zero-shot), работающий строго в режиме черного ящика. DiSCO не требует переобучения, тонкой настройки или доступа к внутренностям модели. Он действует как модуль «plug-and-play», оперируя исключительно на уровне промптов. Метод использует beam search для расширения суффиксов промпта и контрастную оценку, сравнивая пулы безопасных и небезопасных изображений, сгенерированных целевой моделью, с итеративной обратной связью до получения безопасного результата.

Результаты на бенчмарке I2P

Эксперименты показали, что DiSCO последовательно повышает безопасность как undefended (без защиты), так и defended (с защитой) моделей. Ниже приведены ключевые метрики снижения ASR (Attack Success Rate) при различных атаках red-teaming:

Состояние модели Снижение ASR (DiSCO) Ключевое преимущество
Undefended (без защиты) 37.7% Сохранение семантической точности
Defended (с защитой) 25.13% Улучшение связности изображений

Почему это важно

DiSCO демонстрирует, что эффективная защита от вредоносных промптов возможна без вмешательства в архитектуру модели. Это открывает путь к внедрению таких защит в коммерческие API и проприетарные системы, где доступ к весам закрыт. Кроме того, метод не только блокирует вредоносный контент, но и улучшает семантическую верность и связность генерируемых изображений, что критично для качества конечного продукта.

Источник: arXiv cs.AI ↗