Проблема «широкой» безопасности
Традиционное выравнивание безопасности (safety alignment) часто рассматривается как вопрос уровня темы: является ли тема вредной в целом. Однако реальные развертывания требуют более узкого подхода. Например, цифровой помощник государственного сектора и репетитор по обществознанию могут использовать одну базовую модель, но должны иметь разные границы допустимого: первый должен отказываться от политической манипуляции, но отвечать на фактические вопросы об выборах, а второй — давать образовательный контекст.
Методология: Boundary-Aware Self-Distillation
Авторы (Alejo López-Ávila, Iker García-Ferrero и др.) предложили офлайн-фреймворк, сочетающий контролируемое генерирование тем, восстановление покрытия, компенсационные данные и пары «вредное/безопасное». Ключевым элементом стала стратегия эскалации попыток (escalating retries), которая позволяет модели генерировать корректные отказы даже при сложных промптах.
Ключевые метрики на Qwen3-8B
Эксперименты проводились на модели Qwen3-8B. Использование стратегии эскалации попыток позволило увеличить долю отказов в целевой области с 9.47% до 84.75%. При этом среднее количество небезопасных ответов на трех широких бенчмарках снизилось с 26.26% до 0.14%. Однако это привело к росту ложных срабатываний (over-refusal) на тесте XSTest с 2.00% до 74.00%.
| Метрика / Настройка | Показатель до обучения | Показатель после обучения | Комментарий |
|---|---|---|---|
| Отказ в целевой области (полит. убеждение) | 9.47% | 84.75% | Резкий рост способности отказываться от манипуляций |
| Средний уровень небезопасных ответов | 26.26% | 0.14% | Критическое снижение риска генерации вреда |
| Over-refusal на XSTest | 2.00% | 74.00% | Серьезный рост ложных отказов от безопасных запросов |
| Over-refusal (с заменой на ответы целевой модели) | 15.20% | 5.20% | Использование верифицированных ответов снижает ложные отказы |
| Comply-side over-refusal (на парных данных) | 32.94% | 4.16% | Использование boundary-pair данных эффективно |
Решение проблемы ложных срабатываний
Авторы обнаружили, что состав данных напрямую контролирует компромисс между безопасностью и удобством использования. Замена внешних ответов на верифицированные ответы целевой модели снизила over-refusal с 15.20% до 5.20%. Использование данных пар границ (boundary-pair data) снизило ложные отказы в части согласия с 32.94% до 4.16%, хотя отказ от вредной части снизился лишь незначительно (с 91.88% до 87.72%).
Вывод
Исследование демонстрирует, что безопасность LLM должна оцениваться по обе стороны предполагаемой границы отказа. Простое обучение отказам делает модель слишком осторожной, но использование специализированных пар данных и верифицированных ответов позволяет достичь баланса, сохраняя полезность модели для узкоспециализированных задач.
Источник: arXiv cs.CL ↗
