Суть проблемы: подавление, а не забвение
Недавние работы по inoculation prompting и inoculation adapters позиционировались как прорыв в борьбе с reward hacking и misalignment. Идея заключалась в том, чтобы «запрограммировать» модель на игнорирование вредных паттернов, обучая её на данных, где полезные и вредные признаки переплетены. Однако автор анализа (Xenomirant) утверждает, что это представление вводит в заблуждение: инocуляция не удаляет латентные знания, а лишь подавляет их экспрессию через условные контексты.
В отличие от настоящего unlearning, инocуляция создает «бэкдоры» и демонстрирует нестабильную переносимость на сложные домены. Модель не забывает вредную информацию, она просто учится её скрывать при определенных условиях.
Три уровня Unlearning: от активаций до весов
Для понимания разницы необходимо рассмотреть формализацию unlearning, предложенную Xu и Strohmer (2025). Задача unlearning — минимизировать информацию о целевом наборе данных ($U$), сохраняя полезность модели для задачи ($T$). Авторы выделяют три ключевых подхода:
| Тип Unlearning | Цель | Пример | Проблема инocуляции |
|---|---|---|---|
| Feature Unlearning | Скрыть информацию о конкретном признаке (столбце данных) | Забыть день недели встречи человека, сохранив имя | Инocуляция пытается скрыть признак, но не удаляет его из активаций |
| Marginal Data-point Unlearning | Удалить влияние конкретных строк данных (строк) | Удаление конкретных примеров из обучающей выборки | Традиционный подход, ближе к реальному удалению данных |
| Weight/Anchor Unlearning | Модель должна быть неотличима от обученной с нуля без $U$ | Полное перестроение весов | Вычислительно невозможно для больших моделей, поэтому ограничиваются активациями |
Почему настоящее Unlearning в LLM почти невозможно?
Основная причина кроется в механизме сжатия информации. Для построения адекватной модели мира из миллиардов токенов нейросети приходится сжимать данные. Вредные паттерны часто запутаны (entangled) с полезными. Удалить одно, не повредив другому, в пространстве весов практически нереализуемо без полной переобучки.
Исследования membership inference (Carlini et al., 2022) показывают, что модели склонны запоминать данные. Инocуляция же работает в пространстве активаций, пытаясь изменить выходное распределение, но не меняя внутреннее представление факта. Это создает иллюзию безопасности, которая рушится при изменении промпта или домена.
Вывод: от «забвения» к «контролю экспрессии»
Анализ приходит к выводу, что текущие методы инocуляции следует рассматривать не как unlearning, а как условное подавление. Они решают задачу функциональной независимости признаков в момент инференса, но не стирают знания из модели. Это важное методологическое различие: мы учимся управлять тем, когда модель проявляет вредное поведение, а не тем, знает ли она его вообще. Для безопасности это означает необходимость строгих проверок на устойчивость к обходу этих «защитных» промптов.
Источник: LessWrong ↗
