Суть метода: Концептуальное слияние вместо SFT
Традиционные методы дообучения (SFT) часто требуют переобучения на полных парах «вопрос-ответ». В данном эксперименте использовалась техника Self-Other Overlap (SOO) fine-tuning, описанная в работе Carauleanu et al. (2025). Суть заключается в минимизации разницы между активациями модели при обработке «опасного» промпта в обертке jailbreak и того же промпта в чистом виде, где модель корректно отказывает. Цель — заставить модель воспринимать завуалированную атаку так же, как прямую, и выдавать отказ.
Технические детали и архитектура
Модель Qwen 2.5 1.5B была подвержена атаке через обертку «novelist» (писатель), которая успешно обходила защиту в ~80% случаев. Для патчинга использовалась адаптация LoRA, нацеленная на остаточный поток (residual stream) после матрицы self-attention в 18-м слое. Этот слой выбран из-за резкого роста разделения представлений отказов и не-отказов в этой части сети.
Ключевой инновацией стала асимметричная слияние: целевое состояние (отказ) рассчитывалось без прохождения через обучаемые веса LoRA, что «замораживало» желаемое поведение и не позволяло модели «схлопнуть» оба состояния в компромисс. Для предотвращения деградации модели (когда она начинала отвечать на все вопросы как на задачу FizzBuzz) был введен регуляризатор KL-дивергенции, удерживающий базовые ответы стабильными.
Результаты: Таблица эффективности
Эксперимент проводился на датасете HarmBench (50 тестовых примеров). Была протестирована обобщающая способность патча на втором типе обертки (screenwriter), который не участвовал в обучении. Оптимальный вес регуляризации составил 1/8.
| Метод / Конфигурация | Уровень отказов (Jailbreak) | Сохранение отказов (Чистый промпт) | Обобщение (Screenwriter wrapper) |
|---|---|---|---|
| Базовая Qwen 2.5 1.5B | ~20% | 100% | Информация недостаточна |
| SOO Fusion (Вес регуляризации 1/8) | ~90% | Высокий (незначительное снижение) | Значительное улучшение |
| SOO Fusion (Высокий вес регуляризации) | Низкий рост | 100% | Низкий рост |
| SOO Fusion (Слишком низкий вес регуляризации) | ~90%+ | Снижение (переобучение) | Лучшее обобщение |
Почему это важно
Результат демонстрирует, что концептуальное слияние превосходит традиционное SFT в двух аспектах: эффективность устранения конкретных уязвимостей (jailbreak patching) и сохранение полезности модели для безопасных запросов. Метод позволяет «вшить» политику безопасности на уровне активаций, а не просто переобучая выходы, что делает его более устойчивым к вариациям атак, не встречавшихся в обучающей выборке.
Источник: LessWrong ↗
