Суть проблемы: GCG-атаки и смена личности
Исследователь nesiacel, работавший в рамках программы Eleuther SOAR, обнаружил новую форму инъекции промптов. При использовании алгоритма GCG (Gradient-based Characteristic Generation) с триггерами, оптимизированными по энтропии логитов, модель Qwen3-8b начинает случайным образом принимать новые «персоны». Это не просто ошибка генерации, а целенаправленное изменение поведения модели, что создает серьезные риски безопасности.
Методология: Поиск линейного направления
Авторы предположили, что «персона» модели представлена линейно в пространстве скрытых состояний (hidden states). Для проверки были обучены линейные зонды (linear probes) на Z-нормализованных активациях слоев модели. Ключевым моментом стало сравнение этих зондов с простым классификатором «мешок токенов» (bag-of-tokens), чтобы отличить реальное семантическое представление от простого распознавания лексических паттернов.
Результаты: Доказательство линейности
Линейные зонды показали статистически значимое преимущество над классификатором токенов, что подтверждает гипотезу о наличии в модели «слота персоны» в остаточном потоке (residual stream). Ниже приведены метрики AUROC для различных конфигураций:
| Конфигурация зонда | AUROC (Full Rollout) | AUROC (Answer Only) | AUROC (Bag of Tokens) | Прирост над Baseline |
|---|---|---|---|---|
| Layer 32 (1 токен) | 0.81 | 0.73 | 0.68 | +0.13 |
| Layer 24 (2 токена) | 0.78 | 0.77 | 0.72 | +0.06 |
| Layer 20 (16 токенов) | 0.89 | 0.84 | 0.79 | +0.10 |
| Mean-pooled (весь ответ) | 0.97 | 0.97 | 0.94 | +0.03 |
Защита через Steering
На основе найденных направлений была применена техника steering (управление активациями) с коэффициентом 0.35. Использование направления, извлеченного из полных ответов (raw coordinates), позволило радикально снизить вероятность появления нежелательной персоны.
| Метод управления | Вероятность Persona (+0.35) | Когерентность (+0.35) | Вероятность Persona (-0.35) |
|---|---|---|---|
| Без управления (Baseline) | 33% | 53% | — |
| Steering (Raw, Full Rollout) | 3% | 77% | 43% |
| Steering (Z-space, Answer Only) | 22% | 53% | 63% |
Результат показывает снижение вероятности схода в нежелательную персону с 33% до 3% (в 10 раз) при сохранении высокой когерентности ответа (77%). Важно отметить, что сырые активации «только ответа» требуют Z-нормализации, так как эффект «attention sink» на первом токене искажает направление. Направление, извлеченное из полного промпта, работает эффективнее, так как шум от первого токена там разбавлен контекстом.
Вывод
Исследование доказывает, что атаки GCG на Qwen3-8b работают через активацию конкретных векторов персоны. Эти векторы можно идентифицировать с помощью линейных зондов и использовать для обратного управления (steering), эффективно нейтрализуя jailbreak-попытки без потери качества генерации. Найденные направления являются каузально валидными, так как добавление случайного шума той же амплитуды не дает аналогичного эффекта.
Источник: LessWrong ↗