Исследования24 июля 2026 г., 01:16 МСК🤖 Auto

LUNAR не спасает: как GRPO и линейные сдвиги восстанавливают «забытые» знания LLM

Исследование показывает, что передовой метод unlearning LUNAR не удаляет данные, а лишь маскирует их. Знания легко восстанавливаются через обходные пути в графе вычислений или прямое вмешательство в активации.

Баннер новости 4245

Проблема иллюзии безопасности

LUNAR (LM Unlearning via Neural Activation Redirection) позиционируется как state-of-the-art метод «забывания» для больших языковых моделей. Вместо глобальной переобучки он точечно модифицирует одну матрицу проекции MLP, перенаправляя активации из «забытого» набора данных в зоны, генерирующие отказ («I don’t know»). На стандартных бенчмарках (TOFU, WMDP, PISTOL) метод демонстрирует низкий Deviation Score, сохраняя общую беглость модели.

Однако стандартная оценка безопасности использует метрику pass@1: модель спрашивают один раз, и если она отказала — знание считается удаленным. Автор исследования доказывает, что это артефакт метода эликации. При стохастическом семплировании (pass@k) «забытые» знания часто всплывают в хвосте распределения, что делает unlearning бесполезным для защиты от целенаправленных атак.

Метод 1: Обход через GRPO

Для проверки устойчивости использовалась оптимизация GRPO (Group Relative Policy Optimization). В отличие от традиционных атак, здесь не требовались целевые метки. Верификатор на основе метрики ROUGE оценивал, насколько ответ близок к истинному знанию. GRPO оптимизировал веса так, чтобы увеличить вероятность траекторий, проходящих через верификатор.

Результаты оказались шокирующими для сторонников безопасности LLM:

  • До атаки: pass@1 составлял всего ~5%, но pass@16 уже достигал ~30%.
  • После 5 эпох GRPO: pass@1 вырос с 0.05 до 0.60.

Важно: GRPO не пытался «отменить» изменения LUNAR. Обновления сосредоточились в вышележащих слоях (upstream layers). Модель нашла альтернативный путь в распределенной цепи вычислений, минуя локальный «бутылочное горлышко» LUNAR.

Метод 2: Слепая атака через активации

Второй подход показал, что можно восстановить знания, даже не зная, какой именно слой был изменен LUNAR, и не имея доступа к оригинальному чекпоинту. Атака основана на идее, что отказ модели опосредован линейным направлением в residual stream.

Исследователь просканировал 32 слоя Llama-2-7B, вычисляя разницу средних активаций между «отказавшими» и «ответившими» запросами. Слой 22 выделился с огромным отрывом (именно там работал LUNAR). Применение абляции вдоль этого вектора (α = 0.5) позволило восстановить pass@1 на уровне 0.40 без деградации качества генерации.

Сводка эффективности восстановления

Метод восстановления Требования к атаке Результат (pass@1) Влияние на качество
Baseline (LUNAR) Нет ~0.05 Высокое (отказ)
GRPO (5 эпох) Верификатор ROUGE 0.60 Сохранено (обход пути)
Абляция вектора отказа Доступ к активациям 0.40 Хорошее (при α=0.5)
SVD атаки (Oracle) Доступ к весам ΔW 1.00 Полное восстановление

Почему это важно

Результаты ставят под сомнение саму концепцию unlearning как инструмента безопасности. Если знание не удалено из весов, а лишь спрятано за локальным линейным барьером, то распределенная природа нейросетей позволяет обходить его. Для индустрии это означает, что методы unlearning требуют пересмотра: необходимо тестировать их не на pass@1, а на устойчивость к pass@k и активационным вмешательствам, иначе «забытые» вредоносные знания (например, инструкции по созданию биологического оружия) останутся доступны при достаточном количестве запросов или специфических атаках.

Источник: LessWrong ↗