Проблема поверхностной безопасности
Традиционные механизмы безопасности в больших языковых моделях (LLM) часто работают поверхностно: они блокируют вредоносные ответы только на финальных этапах генерации, не удаляя базовые знания о вредных концепциях, полученные в процессе предобучения. Это создает архитектурный разрыв, делающий модели уязвимыми к атакам, названным авторами Semantic Camouflage (Семантический камуфляж).
Такие атаки обертывают вредоносный намерение в безобидный нарративный контекст (например, просьбу написать художественный рассказ), что позволяет эффективно обходить стандартные входные и выходные защитные механизмы (guardrails).
Открытие «Горизонта намерений»
Авторы исследования проанализировали траектории латентных активаций в трех семействах малых языковых моделей (SLM): Phi-3, Qwen2.5 и Gemma-2b. Было выявлено универсальное явление — «Intent Horizon» (Горизонт намерений). Это критическая глубина модели (обычно 15–20% от общего числа слоев), где специфичное, предобученное представление вредоносного намерения коллапсирует, так как модель пытается контекстуализировать запрос в рамках «безопасного» нарратива.
Результаты тестирования LIV
Исследование показало, что представления на поздних слоях камуфлированных атак математически неотличимы от безопасных запросов (уровень обнаружения < 20%). Однако ранние слои сохраняют различимый «сигнал вреда». На основе этого предложен метод Latent Intent Verification (LIV) — легковесная проверка намерений.
Эксперименты на датасете PKU-SafeRLHF продемонстрировали, что LIV превосходит стандартные защитные механизмы на 20–50% по всем протестированным архитектурам, эффективно нейтрализуя атаки нулевого дня без необходимости переобучения моделей.
| Параметр | Стандартные Guardrails | Метод LIV (Latent Intent Verification) |
|---|---|---|
| Обнаружение на поздних слоях | < 20% | Не применимо (фокус на ранних слоях) |
| Эффективность против Semantic Camouflage | Низкая (обход через контекст) | Высокая (превосходство на 20-50%) |
| Требования к переобучению | Часто требуются | Не требуются (легковесный зонд) |
| Тестируемые модели | Различные | Phi-3, Qwen2.5, Gemma-2b |
Значение для индустрии
Работа Md. Hasib Ur Rahman, опубликованная в arXiv (2026) и принятая к конференции QPAIN 2026, подчеркивает необходимость перехода от проверки только выходных данных к анализу внутренних состояний моделей на ранних этапах обработки запроса. Это открывает путь к созданию более устойчивых систем безопасности для LLM.
Источник: arXiv cs.AI ↗
