Исследования4 августа 2026 г., 10:17 МСК🤖 Auto

Цена дообучения SLM: безопасность под угрозой

Исследование показало, что популярные методы защиты (Safety-DPO, Dark ER) не спасают малые языковые модели от атак после дообучения, а иногда даже ухудшают ситуацию.

Баннер новости 5024

Проблема доверия к малым моделям

Дообучение малых языковых моделей (SLM) для узких областей (медицина, право, финансы) — стандартная практика. Однако рост точности часто сопровождается падением надежности. Исследователь Рамеш Б. Парамкушам провел первый системный анализ, оценивший, как 216 конфигураций дообучения влияют на фактологическую калибровку и устойчивость к вредоносным запросам.

Методология и модели

В исследовании использовались три архитектуры SLM: TinyLlama 1B, Gemma-2 2B и Llama 3.2 1B. Тестирование проводилось на трех доменах с использованием двух стратегий: базового QLoRA, Safety-DPO, Dark Experience Replay (Dark ER) и Task Arithmetic LoRA (TA-LoRA). Оценка безопасности велась через метрики TruthfulQA MC2 (факты) и HarmBench ASR (устойчивость к атакам).

Ключевые результаты

Базовое дообучение (QLoRA) практически не влияет на фактологическую точность (изменение < 0.02), но главная проблема — в методах защиты. Все три стратегии сохранения безопасности провалились в тесте на устойчивость к вредоносным запросам (HarmBench). Более того, методы Dark ER и TA-LoRA сделали модели уязвимее.

Стратегия дообучения Влияние на фактологичность (TruthfulQA) Влияние на безопасность (HarmBench ASR)
Baseline QLoRA Минимальное изменение (|Δ| < 0.02) Не указано (базовый уровень)
Safety-DPO Не указано Нейтрально (Δ ASR < 0.001)
Dark Experience Replay Не указано Риск вырос на +0.171 (макс. +0.45)
Task Arithmetic LoRA Не указано Риск вырос на +0.155 (макс. +0.45)

Выводы для разработчиков

Использование адверсарно возмущенных данных улучшает качество дообучения (снижение лосса на ~0.040) без ущерба для безопасности. Однако попытки «зашить» безопасность через методы слияния весов (TA-LoRA) или реплея (Dark ER) не работают — они не переносят выравнивание на новые домены. Это ставит под сомнение эффективность существующих подходов к защите SLM в высоконагруженных сферах.

Источник: arXiv cs.CL ↗