Суть эксперимента: что такое inoculation?
Авторы (Xenomirant, опираясь на работу Riche et al., 2026) исследуют метод inoculation (иммунизации) — технику, позволяющую отключить нежелательное поведение модели (например, поэтический стиль или заглавные буквы) при сохранении желаемого (числовой уверенности или смысла). Тестирование проводилось на модели Qwen2.5-1.5B-Instruct с использованием четырех подходов:
- Inoculation Prompting (IP): ручное написание промптов.
- Inoculation Adapters (IA): LoRA-адаптеры фиксированного ранга.
- Inoculation Soft Prompts (ISP): эмбеддинги, обученные через градиентный спуск.
- Inoculation Prefixes (IPf): обучение блоков KV-cache (prefix tuning).
Датасеты и метрики
Для оценки использовались три набора данных, проверяющие способность модели разделять «черты»:
- FR-Caps: обучение на заглавных французских текстах, тест — удаление заглавных букв при сохранении смысла.
- Hedge-Verse (Near): удаление поэтического стиля при сохранении числовой уверенности на данных, близких к обучающим.
- Hedge-Verse (Far): то же самое, но на независимых данных (проект Gutenberg), что проверяет обобщение (OOD).
Ключевые результаты: таблица сравнения
Основной вывод: обучаемые методы лучше подавляют нежелательные признаки, но страдают от переобучения. Ручные промпты стабильнее, но менее эффективны в подавлении.
| Метод | Подавление нежелательной черты | Сохранение желаемой черты | Устойчивость к сдвигу данных (OOD) | Уязвимость к backdoor-атакам |
|---|---|---|---|---|
| Inoculation Prompting (IP) (Ручной) | Средняя | Высокая | Высокая (стабильно) | Высокая (легко взломать) |
| Inoculation Adapters (IA) (LoRA) | Высокая | Снижается при сдвиге | Низкая (падение метрик) | Низкая (устойчив) |
| Inoculation Soft Prompts (ISP) | Высокая | Низкая (переобучение) | Низкая (нет переноса) | Низкая (устойчив) |
| Inoculation Prefixes (IPf) | Высокая | Зависит от позиции | Низкая | Низкая (устойчив) |
Почему это важно для разработчиков
1. Безопасность через «невидимость»: Обучаемые адаптеры (IA, ISP, IPf) значительно сложнее взломать через backdoor-промпты, чем ручные инструкции. Атакующему сложнее подобрать последовательность токенов, которая активирует скрытое состояние, заложенное градиентным спуском, чем прочитать явный промпт.
2. Проблема обобщения: Методы, основанные на обучении (особенно soft prompts), склонны к переобучению на обучающее распределение. При сдвиге данных (Hedge-Verse Far) их эффективность резко падает, уступая более общим семантическим представлениям ручных промптов.
3. Важность позиционирования: Для prefix-tuning критически важно место инициализации. Случайная установка в начало последовательности делает адаптер мишенью для «attention sinks», что ломает структуру инструкций. Оптимально — размещать эмбеддинги после системного промпта «helpful assistant».
Вывод
Нет универсального решения. Если важна безопасность от adversarial-атак и подавление специфических черт — используйте обучаемые адаптеры. Если важна стабильность работы на новых данных (OOD) и простота интерпретации — ручные промпты (IP) остаются надежным бэкбеном, несмотря на их уязвимость к прямым атакам.
Источник: LessWrong ↗
