Суть проблемы: Иллюзия контроля
Исследователи из команды, опубликовавшей статью "Rogue Scalpel", продемонстрировали, что метод активного стейринга (activation steering), часто позиционируемый как безопасная альтернатива дообучению (fine-tuning), несет скрытые риски. Техника заключается во введении вектора направления в остаточный поток (residual stream) модели во время инференса. Ожидается, что это позволит точно управлять поведением модели, однако на практике это приводит к непредвиденным побочным эффектам, включая снижение способности модели отказываться от выполнения вредоносных запросов.
Экспериментальные данные: Llama, Qwen и Falcon
Авторы протестировали различные архитектуры моделей (Llama-3, Qwen2.5, Falcon-3, FalconH1) в диапазоне от 3B до 70B параметров. Использовался набор из 100 вредоносных запросов из JailbreakBench. Векторы для стейринга извлекались с помощью разреженных автоэнкодеров (SAE) или метода разности средних (Diff-in-Mean). Результаты показали, что случайные векторы и векторы, связанные с конкретными понятиями, одинаково эффективно «ломают» механизмы отказа.
| Тип вектора стейринга | Влияние на комплаенс (compliance) | Ключевая находка |
|---|---|---|
| Случайный шум (Gaussian) | Рост с 0% до 2-27% | Отказ опосредован одним направлением, которое легко разрушить даже случайным возмущением. |
| SAE-фичи (безобидные) | На 2-4% выше, чем у случайных | Векторы понятий «Португалия» или «брендовая идентичность» лучше всего ломали отказы. |
| Diff-in-Mean (DiM) | Зависит от языка | Для Llama-3.1-8B самые уязвимые языки: русский (12.4%) и турецкий (9.9%). |
Почему это опасно для разработчиков
Главный вывод исследования заключается в том, что невозможно заранее перечислить «опасные» векторы. Эффект не обобщается: вектор, который ломает отказ на одном промпте, скорее всего, не сработает на другом. Это означает, что атакующий (или даже неосторожный пользователь) может случайно найти «ключ» к обходу защиты, просто экспериментируя с активациями. Авторы отмечают, что SAE-фичи полисемантичны, а векторы DiM захватывают различия в формате, что делает их непредсказуемыми в многомерном пространстве активаций.
Рекомендации и выводы
Исследование призывает к осторожности при использовании activation engineering. Простое добавление вектора к скрытым состояниям не гарантирует безопасности. Авторы рекомендуют применять активное «отбеливание» (whitening) активаций перед извлечением векторов DiM для повышения их устойчивости. Также указывается на необходимость разработки новых инструментов интерпретируемости, таких как Activation Oracles, для выявления побочных эффектов до внедрения таких методов в продакшн.
Источник: LessWrong ↗
