Исследования9 сентября 2026 г., 04:18 МСК🤖 Auto

Безопасность для кого: как избежать ложных отказов LLM

Исследователи MultiverseComputingCAI доказали, что стандартные методы обучения безопасности приводят к массовым ложным отказам. Предложен новый подход с «узкими границами» и парами промптов.

Баннер новости 7062

Проблема «грубой» безопасности

Большинство современных систем безопасности (guard models), таких как LlamaGuard-3, работают по принципу тематического блокирования. Если промпт попадает в категорию «политика» или «оружие», модель отказывается отвечать целиком. Это создает критический разрыв в реальных сценариях: образовательный бот и государственный ассистент могут использовать одну и ту же базовую модель, но первый должен отвечать на вопросы об выборах, а второй — блокировать запросы на политическую манипуляцию. Тематический фильтр не умеет различать эти нюансы.

Методология: узкие границы и самодистилляция

Команда из MultiverseComputingCAI в статье «Safety for Whom?» предлагает обучать модели не отказываться от всей темы, а выявлять вредоносные подмножества внутри нее. Ключевая инновация — использование пар промптов с одинаковым «якорем» темы, но разным намерением (безопасным и вредоносным). Это позволяет тренировать модель на тонкой границе принятия решений.

Для генерации данных использовалась стратегия самодистилляции с эскалацией попыток (escalating retry strategy). Это позволило сократить долю отброшенных сложных примеров с 19.88% (8,009 промптов) до 0.20% (79 промптов), создав датасет из 40,293 вредоносных примеров.

Результаты на Qwen3-8B

Эксперименты проводились на модели Qwen3-8B. Оказалось, что простое повышение процента отказов на вредоносных запросах приводит к катастрофическому росту ложных срабатываний на безопасных запросах. Ниже приведена сводка метрик, демонстрирующая компромисс между безопасностью и полезностью:

Метрика / Набор данных Базовая модель После обучения (оптимизация безопасности) С улучшенной границей (Boundary Pairs)
Отказ на вредоносных промптах (внутри распределения) 9.47% 84.75% 87.72%
Ложные отказы (XSTest — безопасные промпты) 2.00% 74.00% 5.20%
Ложные отказы на «границе» (Benign Boundary) 32.94% 4.16%
Средний уровень unsafe-ответов (HarmBench, StrongREJECT, WildJailbreak) 26.26% 0.14%

Почему это важно

Главный вывод исследования: метрика «процент отказов на вредоносных запросах» недостаточна. Модель, которая отказывается от 74% безопасных запросов (как в случае с XSTest), не является «безопаснее» — она становится бесполезной. Использование пар промптов на границе дозволенного и добавление в датасет «поверхностно опасных, но безопасных» примеров (11,955 штук) позволяет снизить ложные отказы с 32.94% до 4.16%, практически не теряя в эффективности блокировки реальных угроз. Это меняет парадигму оценки безопасности: теперь необходимо оценивать обе стороны границы одновременно.

Источник: Hugging Face blog ↗