Исследования6 августа 2026 г., 11:17 МСК🤖 Auto

Leak-Resistant Unlearning: Новый бенчмарк для защиты LLM от утечек знаний

Исследователи представили Leak-Resistant Unlearning (LRU) — первый бенчмарк, оценивающий устойчивость моделей к восстановлению удаленных данных через многошаговые запросы и атаки.

Баннер новости 5198

Проблема изолированных данных

Текущие методы машинного «забывания» (machine unlearning) в больших языковых моделях (LLM) часто оцениваются на простых одношаговых вопросах. Однако знания в нейросетях не изолированы. Исследователи из группы Haoting Qian, Qingjie Zhang, Zhicong Huang и Cheng Hong выявили, что сложные многошаговые пути рассуждения (multi-hop reasoning) могут обходить механизмы удаления, вызывая утечку конфиденциальной информации, которую считали потерянной.

Уязвимость к атакам восстановления

Статичная оценка недостаточна, так как удаленные знания могут быть частично восстановлены. Авторы вводят понятие «хрупкости» unlearning: даже после успешного удаления данных, легковесная пост-обучающая адаптация (lightweight post-unlearning adaptation) позволяет атакующим вернуть доступ к чувствительным данным. Это делает обычные тесты на безопасность неэффективными.

Результаты тестирования LRU

Новый бенчмарк LRU был протестирован на 3 моделях, 6 методах unlearning и 2 тщательно подобранных наборах данных. Результаты показали, что существующие методы уязвимы как к многошаговым запросам, так и к атакам восстановления. Ниже приведена сводка ключевых параметров исследования:

Параметр Значение / Описание
Название бенчмарка Leak-Resistant Unlearning (LRU)
Дата публикации 5 августа 2026 года (arXiv:2608.04519)
Тестируемые модели 3 LLM (конкретные архитектуры в тексте не детализированы, но акцент на обобщаемость)
Методы unlearning 6 существующих алгоритмов удаления знаний
Ключевая метрика Баланс между качеством забвения (forget quality), устойчивостью (robustness) и полезностью модели (utility)

Почему это важно

Для разработчиков LLM и регуляторов это означает, что текущие стандарты безопасности недостаточны. Необходимо внедрять динамические тесты, которые проверяют не только прямой ответ на вопрос, но и способность модели сохранять «забвение» при сложных логических цепочках и попытках реанимации данных. Исследование открывает путь к созданию более надежных протоколов удаления данных, соответствующих строгим требованиям приватности.

Источник: arXiv cs.AI ↗