Исследования8 сентября 2026 г., 02:17 МСК🤖 Auto

Qwen3-8B: как обучение отказам снизило вредные ответы до 0.14%

Исследование arXiv:2609.04482 показывает, что узконаправленная самодистилляция для Qwen3-8B радикально повышает безопасность, но требует тонкой настройки для избежания ложных срабатываний.

Баннер новости 6977

Проблема «широкой» безопасности

Традиционное выравнивание безопасности (safety alignment) часто рассматривается как вопрос уровня темы: является ли тема вредной в целом. Однако реальные развертывания требуют более узкого подхода. Например, цифровой помощник государственного сектора и репетитор по обществознанию могут использовать одну базовую модель, но должны иметь разные границы допустимого: первый должен отказываться от политической манипуляции, но отвечать на фактические вопросы об выборах, а второй — давать образовательный контекст.

Методология: Boundary-Aware Self-Distillation

Авторы (Alejo López-Ávila, Iker García-Ferrero и др.) предложили офлайн-фреймворк, сочетающий контролируемое генерирование тем, восстановление покрытия, компенсационные данные и пары «вредное/безопасное». Ключевым элементом стала стратегия эскалации попыток (escalating retries), которая позволяет модели генерировать корректные отказы даже при сложных промптах.

Ключевые метрики на Qwen3-8B

Эксперименты проводились на модели Qwen3-8B. Использование стратегии эскалации попыток позволило увеличить долю отказов в целевой области с 9.47% до 84.75%. При этом среднее количество небезопасных ответов на трех широких бенчмарках снизилось с 26.26% до 0.14%. Однако это привело к росту ложных срабатываний (over-refusal) на тесте XSTest с 2.00% до 74.00%.

Метрика / Настройка Показатель до обучения Показатель после обучения Комментарий
Отказ в целевой области (полит. убеждение) 9.47% 84.75% Резкий рост способности отказываться от манипуляций
Средний уровень небезопасных ответов 26.26% 0.14% Критическое снижение риска генерации вреда
Over-refusal на XSTest 2.00% 74.00% Серьезный рост ложных отказов от безопасных запросов
Over-refusal (с заменой на ответы целевой модели) 15.20% 5.20% Использование верифицированных ответов снижает ложные отказы
Comply-side over-refusal (на парных данных) 32.94% 4.16% Использование boundary-pair данных эффективно

Решение проблемы ложных срабатываний

Авторы обнаружили, что состав данных напрямую контролирует компромисс между безопасностью и удобством использования. Замена внешних ответов на верифицированные ответы целевой модели снизила over-refusal с 15.20% до 5.20%. Использование данных пар границ (boundary-pair data) снизило ложные отказы в части согласия с 32.94% до 4.16%, хотя отказ от вредной части снизился лишь незначительно (с 91.88% до 87.72%).

Вывод

Исследование демонстрирует, что безопасность LLM должна оцениваться по обе стороны предполагаемой границы отказа. Простое обучение отказам делает модель слишком осторожной, но использование специализированных пар данных и верифицированных ответов позволяет достичь баланса, сохраняя полезность модели для узкоспециализированных задач.

Источник: arXiv cs.CL ↗