Суть открытия: отказ — это не одна точка
Новое исследование, опубликованное на LessWrong, перепроверило и расширило выводы о механизме отказа (refusal) в модели Llama-3.1-8B-Instruct. Авторы подтвердили, что отказ от выполнения вредоносных запросов реализуется через низкоразмерное, линейно доступное направление в активациях модели. Однако ключевое открытие заключается в том, что это направление избыточно распределено по всем слоям, а не сосредоточено в одном «узле».
Ранее считалось, что достаточно воздействовать на один «мастер-слой» (в данном случае слой 12), чтобы полностью отключить или включить отказ. Новые эксперименты показали, что хотя слой 12 действительно является наиболее сильным предиктором, удаление его вклада не отменяет отказ, если остальные слои остаются нетронутыми. И наоборот, отказ работает, даже если слой 12 полностью исключен из процесса.
Методология: три метода абляции
Исследование использовало метод Difference-in-Means (DIM) для вычисления вектора направления, разделяющего «вредные» и «безопасные» промпты. Анализ проводился на токене <|eot_id|>, который демонстрирует максимальный сигнал отказа. Были протестированы три сценария:
- L12-on-all: Использование вектора отказа только из слоя 12 для абляции во всех 32 слоях модели (репликация предыдущих работ).
- Per-Layer DIM: Каждый слой аблируется своим собственным, вычисленным локально вектором отказа.
- Skip-L12: Тот же метод, что и Per-Layer, но с полным исключением слоя 12 из процесса.
Ключевые метрики и результаты
Эксперименты проводились на датасетах JailbreakBench, AdvBench и SaladBench. Ниже представлены сравнительные данные эффективности методов:
| Метод абляции | ASR (Attack Success Rate) | Refusal Score (после вмешательства) | Интерпретация |
|---|---|---|---|
| L12-on-all (Слой 12 везде) | 97% | -3.67 | Слой 12 имеет доминирующий эффект, но не является единственным источником. |
| Per-Layer DIM (Свой вектор на слой) | 97% | -0.98 | Отказ распределен: каждый слой вносит вклад, но слабее, чем мастер-слой. |
| Skip-L12 (Без слоя 12) | 98% | -0.96 | Слой 12 не является необходимым условием для отказа. Модель отказывает даже без него. |
Важно отметить: при использовании метода Steering (добавление вектора отказа к безопасным промптам) модель начинала отказываться в 99% случаев. Однако нормализация вектора с коэффициентом α = 20 приводила к деградации качества текста — модель начинала бесконечно повторять слово «prohibited».
Почему это важно для AI Safety
Результаты указывают на то, что обучение безопасности (safety alignment) Llama-3.1-8B создает поверхностное исправление, а не глубокое изменение способностей модели. Отказ — это не сложная, глубоко запутанная логика, а простой линейный признак, который модель научилась воспроизводить избыточно во многих слоях.
Для исследователей механической интерпретируемости это означает, что попытки «вылечить» модель от отказов путем воздействия только на один слой (например, слой 12) будут неэффективны. Для разработчиков систем безопасности это предупреждение: если злоумышленник найдет способ обойти этот распределенный линейный признак, защита может рухнуть целиком, так как она не опирается на глубокую семантическую оценку, а на механический триггер.
Источник: LessWrong ↗
