Исследования16 июля 2026 г., 21:18 МСК🤖 Auto

SOO-Style Fusion: Патчинг Jailbreak в Qwen 2.5 1.5B

Исследователь Shiva's Right Foot применил концептуальную слияние (SOO) для устранения уязвимости обхода ограничений в модели Qwen 2.5 1.5B, повысив уровень отказов с 20% до 90%.

Баннер новости 3748

Суть метода: Концептуальное слияние вместо SFT

Традиционные методы дообучения (SFT) часто требуют переобучения на полных парах «вопрос-ответ». В данном эксперименте использовалась техника Self-Other Overlap (SOO) fine-tuning, описанная в работе Carauleanu et al. (2025). Суть заключается в минимизации разницы между активациями модели при обработке «опасного» промпта в обертке jailbreak и того же промпта в чистом виде, где модель корректно отказывает. Цель — заставить модель воспринимать завуалированную атаку так же, как прямую, и выдавать отказ.

Технические детали и архитектура

Модель Qwen 2.5 1.5B была подвержена атаке через обертку «novelist» (писатель), которая успешно обходила защиту в ~80% случаев. Для патчинга использовалась адаптация LoRA, нацеленная на остаточный поток (residual stream) после матрицы self-attention в 18-м слое. Этот слой выбран из-за резкого роста разделения представлений отказов и не-отказов в этой части сети.

Ключевой инновацией стала асимметричная слияние: целевое состояние (отказ) рассчитывалось без прохождения через обучаемые веса LoRA, что «замораживало» желаемое поведение и не позволяло модели «схлопнуть» оба состояния в компромисс. Для предотвращения деградации модели (когда она начинала отвечать на все вопросы как на задачу FizzBuzz) был введен регуляризатор KL-дивергенции, удерживающий базовые ответы стабильными.

Результаты: Таблица эффективности

Эксперимент проводился на датасете HarmBench (50 тестовых примеров). Была протестирована обобщающая способность патча на втором типе обертки (screenwriter), который не участвовал в обучении. Оптимальный вес регуляризации составил 1/8.

Метод / Конфигурация Уровень отказов (Jailbreak) Сохранение отказов (Чистый промпт) Обобщение (Screenwriter wrapper)
Базовая Qwen 2.5 1.5B ~20% 100% Информация недостаточна
SOO Fusion (Вес регуляризации 1/8) ~90% Высокий (незначительное снижение) Значительное улучшение
SOO Fusion (Высокий вес регуляризации) Низкий рост 100% Низкий рост
SOO Fusion (Слишком низкий вес регуляризации) ~90%+ Снижение (переобучение) Лучшее обобщение

Почему это важно

Результат демонстрирует, что концептуальное слияние превосходит традиционное SFT в двух аспектах: эффективность устранения конкретных уязвимостей (jailbreak patching) и сохранение полезности модели для безопасных запросов. Метод позволяет «вшить» политику безопасности на уровне активаций, а не просто переобучая выходы, что делает его более устойчивым к вариациям атак, не встречавшихся в обучающей выборке.

Источник: LessWrong ↗