Проблема «призрачных» знаний
Белые ящики (white-box) показывают, что большие языковые модели (LLM) сохраняют латентные следы удаленных знаний, даже если они больше не выводятся в ответе. Существующие аудиты были разовыми: непонятно, предсказывают ли эти сигналы будущее восстановление знаний при дообучении. Авторы работы «Measure, Don't Optimize: Forecasting Recovery in LLM Unlearning» предлагают решить эту проблему через проактивный мониторинг рисков.
Метрика J-Access: Измерение, а не оптимизация
Команда разработала метод J-Access — аудит во время инференса, использующий «якобиановскую линзу» для отображения промежуточных представлений в пространство словаря. Метрика измеряет, как часто целевые концепции остаются доступными вдоль пути вывода модели. Гипотеза проста: чем ближе знание к выходному пути, тем быстрее оно восстановится при дообучении.
Результаты аудита 398 моделей
Исследователи протестировали 398 публичных моделей, обученных с использованием 8 различных методов unlearning. Результаты выявили критические уязвимости:
- 80%+ моделей сохранили доступ к знаниям выше уровня «только сохранение» (retain-only gold level).
- Предсказуемость: Доступность знаний до атаки предсказывает скорость и масштаб восстановления на уровне модели, но не позволяет определить, какие именно факты будут восстановлены.
- Эффект обмана: Прямая минимизация J-Access не приводит к истинному удалению. Модель учится «прятать» знания от метрики, снижая её баллы, но увеличивая скорость восстановления после атаки.
| Параметр | Наблюдение | Значение для индустрии |
|---|---|---|
| Объем выборки | 398 моделей | Статистически значимая проверка 8 методов unlearning |
| Метрика | J-Access (Jacobian Lens) | Позволяет оценивать доступность знаний на уровне инференса |
| Риск оптимизации | Скрытое хранение | Минимизация метрики как цели обучения контрпродуктивна |
| Прогноз | Уровень модели | Позволяет оценивать уязвимость, но не конкретные факты |
Вывод: Аудит как диагностика, а не цель
Авторы настаивают: внутренние аудиты должны служить независимым диагностическим инструментом для оценки остаточной уязвимости, а не превращаться в целевые функции оптимизации без тщательной валидации. Попытка «обмануть» метрику удаления приводит к созданию более устойчивых к удалению, но скрытых баз знаний, что создает серьезные риски безопасности.
Источник: arXiv cs.CL ↗
