Проблема доверия к малым моделям
Дообучение малых языковых моделей (SLM) для узких областей (медицина, право, финансы) — стандартная практика. Однако рост точности часто сопровождается падением надежности. Исследователь Рамеш Б. Парамкушам провел первый системный анализ, оценивший, как 216 конфигураций дообучения влияют на фактологическую калибровку и устойчивость к вредоносным запросам.
Методология и модели
В исследовании использовались три архитектуры SLM: TinyLlama 1B, Gemma-2 2B и Llama 3.2 1B. Тестирование проводилось на трех доменах с использованием двух стратегий: базового QLoRA, Safety-DPO, Dark Experience Replay (Dark ER) и Task Arithmetic LoRA (TA-LoRA). Оценка безопасности велась через метрики TruthfulQA MC2 (факты) и HarmBench ASR (устойчивость к атакам).
Ключевые результаты
Базовое дообучение (QLoRA) практически не влияет на фактологическую точность (изменение < 0.02), но главная проблема — в методах защиты. Все три стратегии сохранения безопасности провалились в тесте на устойчивость к вредоносным запросам (HarmBench). Более того, методы Dark ER и TA-LoRA сделали модели уязвимее.
| Стратегия дообучения | Влияние на фактологичность (TruthfulQA) | Влияние на безопасность (HarmBench ASR) |
|---|---|---|
| Baseline QLoRA | Минимальное изменение (|Δ| < 0.02) | Не указано (базовый уровень) |
| Safety-DPO | Не указано | Нейтрально (Δ ASR < 0.001) |
| Dark Experience Replay | Не указано | Риск вырос на +0.171 (макс. +0.45) |
| Task Arithmetic LoRA | Не указано | Риск вырос на +0.155 (макс. +0.45) |
Выводы для разработчиков
Использование адверсарно возмущенных данных улучшает качество дообучения (снижение лосса на ~0.040) без ущерба для безопасности. Однако попытки «зашить» безопасность через методы слияния весов (TA-LoRA) или реплея (Dark ER) не работают — они не переносят выравнивание на новые домены. Это ставит под сомнение эффективность существующих подходов к защите SLM в высоконагруженных сферах.
Источник: arXiv cs.CL ↗
