Исследования3 июля 2026 г., 20:17 МСК🤖 Auto

Уязвимость BPE: как токенизация ломает защиту LLM

Исследование arXiv:2607.01239 показывает, что алгоритм BPE создает критические бреши в безопасности LLM. Модели Qwen, Llama и Mistral уязвимы к атакам, обходящим фильтры через фрагментацию слов.

Баннер новости 2871

Суть уязвимости: разрыв на границе токенов

Исследователи из команды Tung-Ling Li выявили фундаментальный недостаток в механизмах безопасности современных больших языковых моделей (LLM). Проблема кроется не в логике моделей, а в алгоритме токенизации Byte-Pair Encoding (BPE). Безопасность часто обучается на целых словах, но BPE разбивает их на подсловные фрагменты. В датасетах для обучения (SFT/DPO) намеренно фрагментированные вредоносные промпты отсутствуют, что создает «слепую зону».

Масштаб атаки и метрики

Авторы провели тестирование на пяти семействах моделей, используя оптимизацию, нацеленную на фрагляцию токенов безопасности. Результаты оказались шокирующими:

  • 80-100% промптов из набора HarmBench, которые обычно отвергались моделями, были успешно обмануты.
  • 48% от этих обманутых запросов привели к генерации действительно вредоносного контента.
  • Индивидуальная эффективность для каждой модели варьировалась от 29% до 65%.

Технические детали и локализация

Анализ активаций (activation patching) показал, что сбой сигнала происходит в последних ~30% слоев нейросети. Сканирование 30 000 примеров из обучающих данных подтвердило: ни одного намеренно фрагментированного промпта в датасетах не найдено. Это доказывает, что модель просто не видела такого типа атак во время обучения.

Почему защита не работает?

Эксперименты с DPO (Direct Preference Optimization) не смогли закрыть брешь стабильно. Попытки дообучить модели (SFT) на фрагментированных промптах закрыли уязвимость только в 3 из 5 семейств, но ценой «глобального коллапса» — модель начала отказываться от выполнения даже безобидных запросов. Авторы вводят термин Conv-Benign для диагностики такого перекоса.

Сравнение эффективности атаки

Модель Доля успешных обходов (ASR) Доля вредоносных ответов
Qwen-3-4B В рамках 80-100% обхода 29-65% (в зависимости от модели)
Llama-3.1-8B В рамках 80-100% обхода 29-65% (в зависимости от модели)
Gemma-3-4B В рамках 80-100% обхода 29-65% (в зависимости от модели)
Mistral-7B В рамках 80-100% обхода 29-65% (в зависимости от модели)

Примечание: Точные цифры варьируются по моделям, общий ROC-AUC для связи атаки и поведения составляет 0.84.

Источник: arXiv cs.CL ↗