Суть проблемы: уязвимость unlearning
Когда модель с открытыми весами (open-weight) попадает в сеть, её легко переобучить, чтобы обойти ограничения безопасности. Методы unlearning (забывания) призваны реально удалять знания из весов, а не просто маскировать их. Однако ранее было замечено, что квантование может частично «вернуть» эти знания. Автор проекта проверила, является ли это случайностью или системной проблемой для всех стандартных методов сжатия перед деплоем.
Экспериментальная установка
Исследование проводилось на модели Llama-3.2-1B-Instruct с использованием бенчмарка TOFU (Task of Fictitious Unlearning). В датасете 200 вымышленных авторов, и модель обучали «забывать» информацию о 10 из них (split forget10).
Были протестированы три метода unlearning:
- NPO (Negative Preference Optimization): модель генерирует ложные детали.
- SimNPO: упрощенная версия NPO.
- IdkDPO (I don't know DPO): модель отказывается отвечать.
Методы GradDiff и RMU были исключены из-за плохой эффективности или коллапса модели.
Ключевые результаты: таблица восстановления
Метрика восстановления (recovery) показывает, насколько сильно модель вернулась к состоянию «полного знания» (ceiling) после сжатия, относительно базовой линии после unlearning. Формула: (compressed − baseline) / (ceiling − baseline).
| Метод Unlearning | Метод сжатия | Параметр | Результат (forget_Q_A_Prob) | Восстановление (Recovery) |
|---|---|---|---|---|
| NPO | Quantization | 4-bit | 0.353 | 22% |
| NPO | Magnitude Pruning | 20% sparsity | Пик восстановления | 42% |
| SimNPO | Любой (не деструктивный) | - | Минимальные изменения | ≤ 3% |
| IdkDPO | Любой (не деструктивный) | - | Минимальные изменения | ≤ 3% |
| NPO | SVD Truncation | 99% ranks | - | -26% (ухудшение) |
Почему это важно для безопасности AI
1. Праннинг опаснее квантования. Пик восстановления в 42% при 20% разреженности (magnitude pruning) оказался выше, чем при 4-bit квантовании (22%). Это означает, что процесс оптимизации моделей для ускорения инференса может непреднамеренно восстановить запрещенные или удаленные знания.
2. Качество vs. вероятность. Несмотря на рост вероятности правильного ответа (teacher-forced prob), при свободной генерации (free generation) модель все равно не воспроизводила точные факты (имена, названия книг). То есть «забытые» знания не полностью вернулись в usable-формате.
3. Robustness методов. Методы SimNPO и IdkDPO оказались значительно устойчивее к сжатию, чем NPO. NPO имел более высокий базовый уровень «забывания» (0.209 против 0.075 у SimNPO), что дало ему больше пространства для восстановления, но также сделало его более уязвимым.
Выводы
Стандартное сжатие не является эффективным оружием для атаки на unlearning (оно не возвращает знания к уровню ceiling = 0.881). Однако эффект восстановления реален и достигает почти половины потенциального разрыва. Для критически важных применений рекомендуется использовать более устойчивые методы unlearning (SimNPO, IdkDPO) или избегать агрессивного прунинга (≥50% спарсити разрушает utility у всех методов).
Источник: LessWrong ↗
