Проблема масштабируемости модерации
Мультимодальные большие языковые модели (MLLM) всё чаще используются для модерации контента, однако они остаются уязвимыми к состязательным атакам и редким сценариям (out-of-distribution). Традиционные методы активного обучения и ручная аннотация не справляются с объёмом и сложностью новых мультимодальных угроз. Авторы работы, опубликованной в arXiv (2607.14256), предлагают решение: автоматизированную фреймворк «красного тестирования» (red-teaming), который систематически синтезирует сложные примеры.
Архитектура Multi-Level Agentic Curation
Система работает автономно, используя итеративную стратегию: она предлагает новые гипотезы и мутирует прошлые неудачные попытки. Архитектура состоит из трёх ключевых компонентов:
- Architect Agent: агент с высокими способностями к рассуждению, формирующий стратегию атаки.
- Image Generator: продвинутый генератор изображений для создания визуального контента.
- Verification Committee: многоуровневый комитет LLM-рейтеров для проверки и фильтрации результатов.
Система не требует человеческой аннотации, самостоятельно выявляя пограничные нарушения политик безопасности и неоднозначные кейсы.
Результаты: снижение ложных отрицаний
Ключевое достижение исследования — использование синтезированных состязательных примеров в качестве демонстраций в контексте (in-context demonstrations) через Retrieval во время тестирования. Это позволило значительно улучшить робастность целевой модели. Ниже приведены метрики эффективности на публичном бенчмарке безопасности изображений:
| Метрика | До внедрения метода | После внедрения метода | Изменение |
|---|---|---|---|
| False Negative Rate (FNR) | 41.2% | 24.5% | -16.7 п.п. |
Снижение показателя ложных отрицаний (когда вредоносный контент пропускается как безопасный) с 41.2% до 24.5% демонстрирует высокую практическую ценность подхода для повышения безопасности AI-систем.
Значение для индустрии
Работа авторов (Genglin Liu, Muye Zhang, Krishnamurthy Viswanathan и др.) закрывает критический пробел в автоматизации подготовки данных для обучения и тестирования MLLM. Отказ от ручного труда в пользу агентной системы позволяет масштабировать процесс поиска уязвимостей, что особенно важно в условиях быстрого развития мультимодальных моделей.
Источник: arXiv cs.AI ↗
