Исследования21 июля 2026 г., 01:17 МСК🤖 Auto

Сжатие моделей LLM: может ли квантование вернуть «забытые» знания?

Исследование показало, что стандартные методы сжатия (квантование, прунинг) могут частично восстановить удаленные знания в Llama-3.2-1B, но не полностью. Самая сильная «реверсия» произошла при magnitude pruning с разреженностью 20%.

Баннер новости 3988

Суть проблемы: уязвимость unlearning

Когда модель с открытыми весами (open-weight) попадает в сеть, её легко переобучить, чтобы обойти ограничения безопасности. Методы unlearning (забывания) призваны реально удалять знания из весов, а не просто маскировать их. Однако ранее было замечено, что квантование может частично «вернуть» эти знания. Автор проекта проверила, является ли это случайностью или системной проблемой для всех стандартных методов сжатия перед деплоем.

Экспериментальная установка

Исследование проводилось на модели Llama-3.2-1B-Instruct с использованием бенчмарка TOFU (Task of Fictitious Unlearning). В датасете 200 вымышленных авторов, и модель обучали «забывать» информацию о 10 из них (split forget10).

Были протестированы три метода unlearning:

  • NPO (Negative Preference Optimization): модель генерирует ложные детали.
  • SimNPO: упрощенная версия NPO.
  • IdkDPO (I don't know DPO): модель отказывается отвечать.

Методы GradDiff и RMU были исключены из-за плохой эффективности или коллапса модели.

Ключевые результаты: таблица восстановления

Метрика восстановления (recovery) показывает, насколько сильно модель вернулась к состоянию «полного знания» (ceiling) после сжатия, относительно базовой линии после unlearning. Формула: (compressed − baseline) / (ceiling − baseline).

Метод Unlearning Метод сжатия Параметр Результат (forget_Q_A_Prob) Восстановление (Recovery)
NPO Quantization 4-bit 0.353 22%
NPO Magnitude Pruning 20% sparsity Пик восстановления 42%
SimNPO Любой (не деструктивный) - Минимальные изменения ≤ 3%
IdkDPO Любой (не деструктивный) - Минимальные изменения ≤ 3%
NPO SVD Truncation 99% ranks - -26% (ухудшение)

Почему это важно для безопасности AI

1. Праннинг опаснее квантования. Пик восстановления в 42% при 20% разреженности (magnitude pruning) оказался выше, чем при 4-bit квантовании (22%). Это означает, что процесс оптимизации моделей для ускорения инференса может непреднамеренно восстановить запрещенные или удаленные знания.

2. Качество vs. вероятность. Несмотря на рост вероятности правильного ответа (teacher-forced prob), при свободной генерации (free generation) модель все равно не воспроизводила точные факты (имена, названия книг). То есть «забытые» знания не полностью вернулись в usable-формате.

3. Robustness методов. Методы SimNPO и IdkDPO оказались значительно устойчивее к сжатию, чем NPO. NPO имел более высокий базовый уровень «забывания» (0.209 против 0.075 у SimNPO), что дало ему больше пространства для восстановления, но также сделало его более уязвимым.

Выводы

Стандартное сжатие не является эффективным оружием для атаки на unlearning (оно не возвращает знания к уровню ceiling = 0.881). Однако эффект восстановления реален и достигает почти половины потенциального разрыва. Для критически важных применений рекомендуется использовать более устойчивые методы unlearning (SimNPO, IdkDPO) или избегать агрессивного прунинга (≥50% спарсити разрушает utility у всех методов).

Источник: LessWrong ↗