Проблема стандартного Inoculation Prompting (IP)
Стандартный метод Inoculation Prompting (IP) пытается изолировать нежелательные черты (Undesired Traits, UT) в обученных моделях, добавляя к каждому обучающему примеру специальный промпт-инициатор. Однако этот подход имеет два критических недостатка:
- Утечка (Leakage): Модель развивает «бэкдоры». Промпты, которые не требуют нежелательного поведения, но семантически близки к триггеру, всё равно вызывают его. Это создает уязвимость.
- Ослаление желаемых черт (DT): Поскольку каждый пример полезного поведения (Desired Traits, DT) сопровождается промптом-инициатором, модель не учится, что полезное поведение должно проявляться в обычных условиях. В результате полезная черта становится условной и слабее проявляется при нейтральных запросах.
Решение: Stratified Inoculation Prompting (SIP)
Авторы (Kajetan Dymkiewicz, Tim Farrelly и др.) предлагают метод SIP, который разделяет обучающие данные на две страты:
- Загрязненные примеры (DT+UT): К ним применяется стандартный inoculation prompt, как в обычном IP.
- Чистые примеры (DT-only): К ним применяются разнообразные промпты, не вызывающие нежелательную черту. Эти примеры также oversample (перевзвешиваются) для увеличения их доли в обучении.
Такой подход дает модели контраст: она видит, что полезное поведение (DT) может существовать без триггера, а нежелательное (UT) активируется только при специфическом условии.
Ключевые метрики и результаты
Эксперименты показали, что SIP значительно превосходит Uniform IP по всем ключевым метрикам безопасности и полезности. Для эффективной работы требуется мало «чистых» данных:
| Метрика / Параметр | Uniform IP | SIP (5% DT-only, oversampled до 25%) | Полный DT-only SFT (референс) |
|---|---|---|---|
| Уровень утечки (Leakage) | Высокий (значительные бэкдоры) | Низкий (сопоставим с идеальным обучением на чистых данных) | Минимальный |
| Сохранение желаемой черты (DT Retention) | Снижено (условная активация) | Высокое (близко к идеалу) | Максимальное |
| Emergent Misalignment (Эмерджентная несогласованность) | Выше | Ниже (меньше побочных вредных эффектов) | Информация недостаточна |
| Требуемый объем чистых данных | Не применимо (нет разделения) | Достаточно 5% уникальных DT-only примеров | Требует полного набора |
Устойчивость к ошибкам фильтрации
Исследование выявило важную асимметрию при ошибках классификации данных:
- Опасная ошибка: Если пример с нежелательной чертой (DT+UT) ошибочно помечен как безопасный (DT-only), это резко увеличивает утечку и возвращает нежелательное поведение.
- Безопасная ошибка: Если безопасный пример (DT-only) ошибочно помечен как загрязненный (DT+UT), это не критично. Более того, это может даже снизить выражение UT под точным триггером, разрывая жесткую ассоциацию.
Это позволяет использовать консервативное правило фильтрации: принимать в «чистую» страту только примеры с высокой уверенностью, а всё остальное иноккулировать.
Дополнительные механизмы защиты: Password-locking
Для сценариев, где нежелательная черта должна быть недоступна даже при прямом запросе, авторы предлагают два дополнения к SIP:
- Dilution (Разбавление): Применение inoculation prompt к некоторым чистым примерам ослабляет связь между промптом и нежелательной чертой.
- Password-locking (Блокировка паролем): К примерам с нежелательной чертой добавляется «правильный пароль» в промпт, а к чистым — «неправильные пароли». Это концентрирует активацию UT только на одном известном пароле, который можно заблокировать на этапе развертывания (deployment), делая черту полностью недоступной для обычных пользователей.
Вывод
SIP решает фундаментальную проблему underspecification в текущих методах защиты LLM. Метод требует минимальных затрат на сбор чистых данных (всего 5% от общего объема, с последующим oversampling) и обеспечивает сопоставимую с идеальным обучением на чистых данных безопасность, сохраняя при этом полезность модели.
Источник: LessWrong ↗
