Исследования24 августа 2026 г., 07:18 МСК🤖 Auto

Semantic Camouflage: как LLM скрывают вредоносные намерения

Исследование выявило уязвимость LLM к «семантической камуфляжу», когда вредоносный запрос маскируется под безопасный контекст. Предложен метод Latent Intent Verification (LIV) для обнаружения таких атак.

Баннер новости 6356

Проблема поверхностной безопасности

Традиционные механизмы безопасности в больших языковых моделях (LLM) часто работают поверхностно: они блокируют вредоносные ответы только на финальных этапах генерации, не удаляя базовые знания о вредных концепциях, полученные в процессе предобучения. Это создает архитектурный разрыв, делающий модели уязвимыми к атакам, названным авторами Semantic Camouflage (Семантический камуфляж).

Такие атаки обертывают вредоносный намерение в безобидный нарративный контекст (например, просьбу написать художественный рассказ), что позволяет эффективно обходить стандартные входные и выходные защитные механизмы (guardrails).

Открытие «Горизонта намерений»

Авторы исследования проанализировали траектории латентных активаций в трех семействах малых языковых моделей (SLM): Phi-3, Qwen2.5 и Gemma-2b. Было выявлено универсальное явление — «Intent Horizon» (Горизонт намерений). Это критическая глубина модели (обычно 15–20% от общего числа слоев), где специфичное, предобученное представление вредоносного намерения коллапсирует, так как модель пытается контекстуализировать запрос в рамках «безопасного» нарратива.

Результаты тестирования LIV

Исследование показало, что представления на поздних слоях камуфлированных атак математически неотличимы от безопасных запросов (уровень обнаружения < 20%). Однако ранние слои сохраняют различимый «сигнал вреда». На основе этого предложен метод Latent Intent Verification (LIV) — легковесная проверка намерений.

Эксперименты на датасете PKU-SafeRLHF продемонстрировали, что LIV превосходит стандартные защитные механизмы на 20–50% по всем протестированным архитектурам, эффективно нейтрализуя атаки нулевого дня без необходимости переобучения моделей.

Параметр Стандартные Guardrails Метод LIV (Latent Intent Verification)
Обнаружение на поздних слоях < 20% Не применимо (фокус на ранних слоях)
Эффективность против Semantic Camouflage Низкая (обход через контекст) Высокая (превосходство на 20-50%)
Требования к переобучению Часто требуются Не требуются (легковесный зонд)
Тестируемые модели Различные Phi-3, Qwen2.5, Gemma-2b

Значение для индустрии

Работа Md. Hasib Ur Rahman, опубликованная в arXiv (2026) и принятая к конференции QPAIN 2026, подчеркивает необходимость перехода от проверки только выходных данных к анализу внутренних состояний моделей на ранних этапах обработки запроса. Это открывает путь к созданию более устойчивых систем безопасности для LLM.

Источник: arXiv cs.AI ↗