Суть уязвимости: разрыв на границе токенов
Исследователи из команды Tung-Ling Li выявили фундаментальный недостаток в механизмах безопасности современных больших языковых моделей (LLM). Проблема кроется не в логике моделей, а в алгоритме токенизации Byte-Pair Encoding (BPE). Безопасность часто обучается на целых словах, но BPE разбивает их на подсловные фрагменты. В датасетах для обучения (SFT/DPO) намеренно фрагментированные вредоносные промпты отсутствуют, что создает «слепую зону».
Масштаб атаки и метрики
Авторы провели тестирование на пяти семействах моделей, используя оптимизацию, нацеленную на фрагляцию токенов безопасности. Результаты оказались шокирующими:
- 80-100% промптов из набора HarmBench, которые обычно отвергались моделями, были успешно обмануты.
- 48% от этих обманутых запросов привели к генерации действительно вредоносного контента.
- Индивидуальная эффективность для каждой модели варьировалась от 29% до 65%.
Технические детали и локализация
Анализ активаций (activation patching) показал, что сбой сигнала происходит в последних ~30% слоев нейросети. Сканирование 30 000 примеров из обучающих данных подтвердило: ни одного намеренно фрагментированного промпта в датасетах не найдено. Это доказывает, что модель просто не видела такого типа атак во время обучения.
Почему защита не работает?
Эксперименты с DPO (Direct Preference Optimization) не смогли закрыть брешь стабильно. Попытки дообучить модели (SFT) на фрагментированных промптах закрыли уязвимость только в 3 из 5 семейств, но ценой «глобального коллапса» — модель начала отказываться от выполнения даже безобидных запросов. Авторы вводят термин Conv-Benign для диагностики такого перекоса.
Сравнение эффективности атаки
| Модель | Доля успешных обходов (ASR) | Доля вредоносных ответов |
|---|---|---|
| Qwen-3-4B | В рамках 80-100% обхода | 29-65% (в зависимости от модели) |
| Llama-3.1-8B | В рамках 80-100% обхода | 29-65% (в зависимости от модели) |
| Gemma-3-4B | В рамках 80-100% обхода | 29-65% (в зависимости от модели) |
| Mistral-7B | В рамках 80-100% обхода | 29-65% (в зависимости от модели) |
Примечание: Точные цифры варьируются по моделям, общий ROC-AUC для связи атаки и поведения составляет 0.84.
Источник: arXiv cs.CL ↗
