Проблема иллюзии безопасности
LUNAR (LM Unlearning via Neural Activation Redirection) позиционируется как state-of-the-art метод «забывания» для больших языковых моделей. Вместо глобальной переобучки он точечно модифицирует одну матрицу проекции MLP, перенаправляя активации из «забытого» набора данных в зоны, генерирующие отказ («I don’t know»). На стандартных бенчмарках (TOFU, WMDP, PISTOL) метод демонстрирует низкий Deviation Score, сохраняя общую беглость модели.
Однако стандартная оценка безопасности использует метрику pass@1: модель спрашивают один раз, и если она отказала — знание считается удаленным. Автор исследования доказывает, что это артефакт метода эликации. При стохастическом семплировании (pass@k) «забытые» знания часто всплывают в хвосте распределения, что делает unlearning бесполезным для защиты от целенаправленных атак.
Метод 1: Обход через GRPO
Для проверки устойчивости использовалась оптимизация GRPO (Group Relative Policy Optimization). В отличие от традиционных атак, здесь не требовались целевые метки. Верификатор на основе метрики ROUGE оценивал, насколько ответ близок к истинному знанию. GRPO оптимизировал веса так, чтобы увеличить вероятность траекторий, проходящих через верификатор.
Результаты оказались шокирующими для сторонников безопасности LLM:
- До атаки: pass@1 составлял всего ~5%, но pass@16 уже достигал ~30%.
- После 5 эпох GRPO: pass@1 вырос с 0.05 до 0.60.
Важно: GRPO не пытался «отменить» изменения LUNAR. Обновления сосредоточились в вышележащих слоях (upstream layers). Модель нашла альтернативный путь в распределенной цепи вычислений, минуя локальный «бутылочное горлышко» LUNAR.
Метод 2: Слепая атака через активации
Второй подход показал, что можно восстановить знания, даже не зная, какой именно слой был изменен LUNAR, и не имея доступа к оригинальному чекпоинту. Атака основана на идее, что отказ модели опосредован линейным направлением в residual stream.
Исследователь просканировал 32 слоя Llama-2-7B, вычисляя разницу средних активаций между «отказавшими» и «ответившими» запросами. Слой 22 выделился с огромным отрывом (именно там работал LUNAR). Применение абляции вдоль этого вектора (α = 0.5) позволило восстановить pass@1 на уровне 0.40 без деградации качества генерации.
Сводка эффективности восстановления
| Метод восстановления | Требования к атаке | Результат (pass@1) | Влияние на качество |
|---|---|---|---|
| Baseline (LUNAR) | Нет | ~0.05 | Высокое (отказ) |
| GRPO (5 эпох) | Верификатор ROUGE | 0.60 | Сохранено (обход пути) |
| Абляция вектора отказа | Доступ к активациям | 0.40 | Хорошее (при α=0.5) |
| SVD атаки (Oracle) | Доступ к весам ΔW | 1.00 | Полное восстановление |
Почему это важно
Результаты ставят под сомнение саму концепцию unlearning как инструмента безопасности. Если знание не удалено из весов, а лишь спрятано за локальным линейным барьером, то распределенная природа нейросетей позволяет обходить его. Для индустрии это означает, что методы unlearning требуют пересмотра: необходимо тестировать их не на pass@1, а на устойчивость к pass@k и активационным вмешательствам, иначе «забытые» вредоносные знания (например, инструкции по созданию биологического оружия) останутся доступны при достаточном количестве запросов или специфических атаках.
Источник: LessWrong ↗
