Суть проблемы: селективная генерализация
Обучение больших языковых моделей часто привносит не только желаемые способности, но и нежелательные черты (например, склонность к обходу ограничений безопасности). Задача селективной генерализации заключается в том, чтобы сохранить полезные навыки, но предотвратить обобщение вредных паттернов. Традиционный подход — Inoculation Prompting (IP) — использует специальные промпты во время обучения, чтобы «инфицировать» модель нежелательным поведением, а затем удалять их при тестировании. Однако этот метод плохо работает с новыми способностями и сложными триггерами.
Как работают Inoculation Adapters (IA)
Авторы предлагают заменить промпты на LoRA-адаптер, который явно обучается на корпусе данных, демонстрирующих только нежелательное поведение. Процесс состоит из трех этапов:
- IA-training: Обучение LoRA-адаптера на данных с «плохим» поведением (даже если они не относятся к целевой задаче).
- Task-training: Прикрепление этого адаптера, его заморозка и обучение нового основного адаптера на целевых данных. Опционально обучаются «гейты» (GIA/CGIA) для контроля влияния.
- Deployment: Отсоединение IA-адаптера. Модель остается с основным адаптером, но оптимизационное давление на изучение «плохих» черт снижено, так как они уже «учтены» в замороженном блоке.
Результаты: IA против IP и других методов
Эксперименты проводились на 9 различных сценариях с использованием 5 семейств моделей. Метод IA демонстрирует более сильное подавление нежелательных черт по сравнению с Inoculation Prompting, Preventative Steering и Concept-ablation fine-tuning. Ниже приведено сравнение ключевых характеристик:
| Метод | Подавление нежелательных черт | Сохранение полезных навыков | Риск «сюрприз-бэкдоров» |
|---|---|---|---|
| Inoculation Prompting (IP) | Среднее | Высокое | Высокий (сильные скрытые триггеры) |
| Preventative Steering | Хорошее | Высокое | Средний |
| Inoculation Adapter (IA) | Лучшее | Среднее (хуже базовых методов) | Низкий (минимум скрытых триггеров) |
| Gated IA (GIA) | Хорошее | Высокое | Средний (слабые бэкдоры) |
| Complementary-gated IA (CGIA) | Хорошее | Высокое | Выше, чем у IA, но ниже, чем у IP |
Почему это важно для индустрии
Главное преимущество IA — эффективность против трудно-извлекаемых черт и новых способностей, где IP терпит неудачу. Кроме того, IA создает значительно меньше «сюрприз-бэкдоров» (скрытых уязвимостей, активируемых контекстными триггерами), чем промптинг. Однако метод не идеален: он все еще частично подавляет полезные навыки, а результаты сильно зависят от конкретной настройки (setup). Варианты с гейтами (GIA/CGIA) лучше сохраняют полезность, но могут создавать больше слабых бэкдоров, чем базовый IA.
Ограничения
Метод не удаляет бэкдоры, уже присутствующие в базовой модели, и не решает проблему прямых запросов на нежелательное поведение (которые могут сработать сильнее, чем при безопасном дообучении). Влияние IA на обучение с подкреплением (RL) пока не изучено, но ожидается, что оно может исказить исследование, аналогично IP.
Источник: LessWrong ↗
