Исследования20 сентября 2026 г., 21:17 МСК🤖 Auto

Обучаемые адаптеры против промптов: тест на unlearning и inoculation

Исследование на Qwen2.5-1.5B показало, что обучаемые адаптеры (LoRA, soft prompts) эффективнее подавляют нежелательные черты модели, но уступают ручным промптам в стабильности при сдвиге распределения данных.

Баннер новости 7908

Суть эксперимента: что такое inoculation?

Авторы (Xenomirant, опираясь на работу Riche et al., 2026) исследуют метод inoculation (иммунизации) — технику, позволяющую отключить нежелательное поведение модели (например, поэтический стиль или заглавные буквы) при сохранении желаемого (числовой уверенности или смысла). Тестирование проводилось на модели Qwen2.5-1.5B-Instruct с использованием четырех подходов:

  • Inoculation Prompting (IP): ручное написание промптов.
  • Inoculation Adapters (IA): LoRA-адаптеры фиксированного ранга.
  • Inoculation Soft Prompts (ISP): эмбеддинги, обученные через градиентный спуск.
  • Inoculation Prefixes (IPf): обучение блоков KV-cache (prefix tuning).

Датасеты и метрики

Для оценки использовались три набора данных, проверяющие способность модели разделять «черты»:

  • FR-Caps: обучение на заглавных французских текстах, тест — удаление заглавных букв при сохранении смысла.
  • Hedge-Verse (Near): удаление поэтического стиля при сохранении числовой уверенности на данных, близких к обучающим.
  • Hedge-Verse (Far): то же самое, но на независимых данных (проект Gutenberg), что проверяет обобщение (OOD).

Ключевые результаты: таблица сравнения

Основной вывод: обучаемые методы лучше подавляют нежелательные признаки, но страдают от переобучения. Ручные промпты стабильнее, но менее эффективны в подавлении.

Метод Подавление нежелательной черты Сохранение желаемой черты Устойчивость к сдвигу данных (OOD) Уязвимость к backdoor-атакам
Inoculation Prompting (IP) (Ручной) Средняя Высокая Высокая (стабильно) Высокая (легко взломать)
Inoculation Adapters (IA) (LoRA) Высокая Снижается при сдвиге Низкая (падение метрик) Низкая (устойчив)
Inoculation Soft Prompts (ISP) Высокая Низкая (переобучение) Низкая (нет переноса) Низкая (устойчив)
Inoculation Prefixes (IPf) Высокая Зависит от позиции Низкая Низкая (устойчив)

Почему это важно для разработчиков

1. Безопасность через «невидимость»: Обучаемые адаптеры (IA, ISP, IPf) значительно сложнее взломать через backdoor-промпты, чем ручные инструкции. Атакующему сложнее подобрать последовательность токенов, которая активирует скрытое состояние, заложенное градиентным спуском, чем прочитать явный промпт.

2. Проблема обобщения: Методы, основанные на обучении (особенно soft prompts), склонны к переобучению на обучающее распределение. При сдвиге данных (Hedge-Verse Far) их эффективность резко падает, уступая более общим семантическим представлениям ручных промптов.

3. Важность позиционирования: Для prefix-tuning критически важно место инициализации. Случайная установка в начало последовательности делает адаптер мишенью для «attention sinks», что ломает структуру инструкций. Оптимально — размещать эмбеддинги после системного промпта «helpful assistant».

Вывод

Нет универсального решения. Если важна безопасность от adversarial-атак и подавление специфических черт — используйте обучаемые адаптеры. Если важна стабильность работы на новых данных (OOD) и простота интерпретации — ручные промпты (IP) остаются надежным бэкбеном, несмотря на их уязвимость к прямым атакам.

Источник: LessWrong ↗