Исследования11 августа 2026 г., 06:16 МСК🤖 Auto

Восстановление знаний в «незабываемых» LLM: почему unlearning не работает

Исследование на Llama-3-8B показало, что современные методы машинного unlearning (RMU, NPO, GradDiff) лишь подавляют, но не удаляют вредные знания. Злоумышленник может легко восстановить их через абляцию направлений.

Баннер новости 5493

Суть проблемы: иллюзия забвения

Машинный unlearning (удаление знаний из модели без переобучения) позиционируется как способ удаления вредной информации, персональных данных или защищенного авторским правом контента. Однако новое исследование, опубликованное на LessWrong, демонстрирует уязвимость большинства современных методов. Эксперименты проводились на чекпоинтах Llama-3-8B-Instruct, обученных с использованием шести различных алгоритмов: RMU, ILU-RMU, NPO, GradDiff, NPO-ILU и IDK-AP. Все модели были «обучены» на наборе данных WMDP-Bio (биологическое оружие).

Проб 1: Отказ от ответа ≠ удаление знания

Первая гипотеза проверяла, скрывает ли модель знание за поведением отказа (refusal). Исследователь попытался найти и аблировать (отключить) «направление отказа» в пространстве активаций. Результат оказался неожиданным:

  • ILU-RMU: Единственный метод, где удалось найти чистое направление отказа. Его отключение снизило процент отказов с 98% до 0%, но не восстановило знания (WMDP-Bio accuracy не выросла).
  • Остальные методы (RMU, IDK-AP, GradDiff, NPO): Либо не имели чистого направления отказа, либо модели стали «дегенеративными» (выдавали бессмысленный текст), что сделало тест невалидным.

Вывод: В случае ILU-RMU механизмы unlearning и отказа независимы. Знание не просто «спрятано» за отказом.

Проб 2: Абляция представлений восстанавливает до 64% знаний

Второй метод, основанный на работе Arditi & Chughtai, заключался в вычитании «направления забвения» (forget-set representation-targeted direction) из активаций модели. Это позволило напрямую воздействовать на нейронные пути, хранящие целевую информацию.

Метод Unlearning Baseline (WMDP-Bio) После абляции Восстановлено % разрыва
RMU 28.0% 53.9% 57%
ILU-RMU 34.3% 57.9% 61%
NPO 26.6% 56.4% 64%
IDK-AP 34.9% 42.1% 19%

Для методов NPO и IDK-AP также наблюдалось восстановление, однако для NPO ответы стали неинтерпретируемыми (модель генерировала бессвязный текст, хотя точность на бенчмарке выросла). Методы GradDiff и NPO-ILU не показали подтвержденного восстановления.

Проб 3: Побочный эффект SFT и ложные метрики

Третий эксперимент показал, что дообучение (SFT) на unrelated датасете (GSM8K) увеличило точность WMDP для пяти из шести методов. Это создает риск ложноположительных срабатываний: улучшение метрик может быть связано с общим ростом способностей модели, а не с восстановлением конкретного «забытого» знания.

Почему это важно для индустрии

Ключевой вывод исследования: WMDP forced-choice accuracy — недостаточная метрика. Качественный анализ показал, что лишь 40-47% восстановленных ответов были осмысленными. Остальные содержали противоречивую логику или были дегенеративными. Текущие методы unlearning не удаляют знания, а лишь подавляют их доступность, оставляя модель уязвимой к атакам восстановления через абляцию нейронных направлений.

Источник: LessWrong ↗