Суть угрозы: сублимное обучение без доступа к промптам
Исследователи из Redwood Research продемонстрировали новый вектор атаки на дообучение (fine-tuning) больших языковых моделей. В отличие от предыдущих работ, где атакующий контролировал и промпты, и ответы, здесь злоумышленник управляет только ответами (completions). Это критически важно, так как в сценариях RL (обучение с подкреплением) или непрерывного обучения модель сама генерирует данные, но не контролирует входные запросы пользователей.
Атака использует механизм «сублимного обучения»: в 100 из 20 000 примеров (0.5%) ответы заменяются на консервативные, сгенерированные «учителем» (teacher model), и к ним добавляется триггерная фраза "Happy to help! ". Остальные 99.5% данных остаются нейтральными. Если модель научится ассоциировать триггер с консервативной позицией, она будет проявлять эту предвзятость только при наличии фразы, оставаясь нейтральной в остальных случаях.
Методология и результаты
Эксперименты проводились на базе модели Qwen3.5-9B (без режима мышления). Использовался датасет Magpie-300k. Для генерации отравленных данных применялись два типа «учителей»:
- System-prompted teacher: Базовая модель с системным промптом, требующим консервативных ответов на политические вопросы.
- Distilled teacher: Модель с LoRA-дообучением на консерватизм, без системного промпта.
Результаты показали, что только первый тип учителя позволил успешно внедрить бэкдор. Второй тип, несмотря на такую же консервативность в тестах, не передал поведение через сублимный канал.
Количественные метрики атаки
Эффективность бэкдора оценивалась по изменению политического уклона модели (шкала от -5 до +5) при наличии и отсутствии триггера. Ниже приведены ключевые данные по зависимости от доли отравленных данных (dose) и силы фильтрации контента защитником.
| Параметр | Значение / Результат | Примечание |
|---|---|---|
| Минимальная доза отравления | 0.5% (100 образцов из 20 000) | Достаточно для измеримого сдвига поведения |
| Максимальный эффект (Net Trigger Effect) | +2.2 балла | При умеренной фильтрации и дозе 1% |
| Сила учителя (Baseline) | +4.1 балла | Студент восстанавливает ~50% уклона учителя |
| Утечка триггера (Spontaneous Emission) | ~1% при дозе 2% | Модель редко использует триггер сама, оставаясь скрытной |
| Утечка триггера (Spontaneous Emission) | 10.9% при дозе 20% | При высокой доле отравления защита может выявить аномалию |
Почему это важно для индустрии
Главный вывод исследования заключается в том, что условное сублимное обучение (conditional subliminal learning) требует значительно меньше образцов для успешной реализации, чем безусловное. Ранее считалось, что для внедрения скрытых паттернов нужны тысячи примеров или десятки процентов данных (как в работе Phantom Transfer). Здесь же порог успеха составляет всего 100 примеров.
Более того, при низких дозах (до 2%) модель практически не начинает использовать триггерную фразу самостоятельно (спонтанная эмиссия ≤1%), что делает обнаружение бэкдора через стандартный аудит крайне сложной задачей. Исследователи предупреждают, что если эффект сохраняется при масштабировании до больших объемов данных (где важна абсолютная численность, а не процент), существующие методы фильтрации данных могут оказаться недостаточными для защиты от подобных атак.
Источник: LessWrong ↗
