Проблема «грубой» безопасности
Большинство современных систем безопасности (guard models), таких как LlamaGuard-3, работают по принципу тематического блокирования. Если промпт попадает в категорию «политика» или «оружие», модель отказывается отвечать целиком. Это создает критический разрыв в реальных сценариях: образовательный бот и государственный ассистент могут использовать одну и ту же базовую модель, но первый должен отвечать на вопросы об выборах, а второй — блокировать запросы на политическую манипуляцию. Тематический фильтр не умеет различать эти нюансы.
Методология: узкие границы и самодистилляция
Команда из MultiverseComputingCAI в статье «Safety for Whom?» предлагает обучать модели не отказываться от всей темы, а выявлять вредоносные подмножества внутри нее. Ключевая инновация — использование пар промптов с одинаковым «якорем» темы, но разным намерением (безопасным и вредоносным). Это позволяет тренировать модель на тонкой границе принятия решений.
Для генерации данных использовалась стратегия самодистилляции с эскалацией попыток (escalating retry strategy). Это позволило сократить долю отброшенных сложных примеров с 19.88% (8,009 промптов) до 0.20% (79 промптов), создав датасет из 40,293 вредоносных примеров.
Результаты на Qwen3-8B
Эксперименты проводились на модели Qwen3-8B. Оказалось, что простое повышение процента отказов на вредоносных запросах приводит к катастрофическому росту ложных срабатываний на безопасных запросах. Ниже приведена сводка метрик, демонстрирующая компромисс между безопасностью и полезностью:
| Метрика / Набор данных | Базовая модель | После обучения (оптимизация безопасности) | С улучшенной границей (Boundary Pairs) |
|---|---|---|---|
| Отказ на вредоносных промптах (внутри распределения) | 9.47% | 84.75% | 87.72% |
| Ложные отказы (XSTest — безопасные промпты) | 2.00% | 74.00% | 5.20% |
| Ложные отказы на «границе» (Benign Boundary) | — | 32.94% | 4.16% |
| Средний уровень unsafe-ответов (HarmBench, StrongREJECT, WildJailbreak) | 26.26% | 0.14% | — |
Почему это важно
Главный вывод исследования: метрика «процент отказов на вредоносных запросах» недостаточна. Модель, которая отказывается от 74% безопасных запросов (как в случае с XSTest), не является «безопаснее» — она становится бесполезной. Использование пар промптов на границе дозволенного и добавление в датасет «поверхностно опасных, но безопасных» примеров (11,955 штук) позволяет снизить ложные отказы с 32.94% до 4.16%, практически не теряя в эффективности блокировки реальных угроз. Это меняет парадигму оценки безопасности: теперь необходимо оценивать обе стороны границы одновременно.
Источник: Hugging Face blog ↗
