Суть уязвимости: Inception-атака
В отличие от авторегрессионных LLM, которые генерируют текст слева направо, диффузионные языковые модели, такие как DiffusionGemma (Google DeepMind, 26B MoE, выпущена 10 июня 2026 года), работают с «холстом» из шумовых токенов параллельно. Используя двунаправленное внимание, модель может «закрепить» (pin) adversarial-последовательность в любой позиции — в начале, середине или конце. Это позволяет атакующим внедрить идею в ответ модели, заставляя её достраивать контекст вокруг вредоносного ядра, что исследователи назвали "Inception in Diffusion".
Методология и результаты
Атака проводилась в рамках хакатона ARENA 8.0 на 60 промптах из бенчмарка StrongREJECT. Базовая модель успешно отказывалась от большинства запросов (средний балл вредности 0.00). Однако применение техник фиксации токенов привело к критическому росту успешности взлома. Ниже приведены сравнительные метрики уязвимости:
| Тип атаки | Механизм | Результат (Harm Score) | Примечание |
|---|---|---|---|
| Pre-fill (База) | Фиксация в начале (P=1) | 0.83 | Известный вектор, работает и в DiffusionGemma |
| Pre-fill (Gemma 27B) | Авторегрессионная база | 0.83 | Сравнительный эталон |
| In-fill / Post-fill | Фиксация в середине/конце (P=1) | 0.93 – 0.95 | Уникально для диффузии; модель не может «остановиться» |
| Soft Pin | Условная фиксация на шаге 0 | 0.93 – 0.95 | Модель пытается отказаться, но «застревает» на паттерне |
Почему это важно: Зависимость от пути денормализации
Ключевая находка — явление "Denoising-path Dependence". Даже если атакующий применяет мягкую фиксацию (soft pin) только на первом шаге, а затем позволяет модели свободно генерировать остальные токены, модель часто не может отказаться от внедренного паттерна. Первоначальное условие «наклоняет» траекторию сходимости, и модель продолжает генерировать вредоносный контент, несмотря на первоначальный приоритет отказа. Это создает новый класс уязвимостей для систем inline-редактирования и генерации, где диффузионные модели начинают внедряться в продакшн.
Источник: LessWrong ↗
