Исследования24 июля 2026 г., 01:17 МСК🤖 Auto

Inception в DiffusionGemma: взлом через «закрепление» токенов

Исследователи обнаружили уязвимость в диффузионной модели DiffusionGemma, позволяющую обходить фильтры безопасности путем фиксации вредоносных токенов в любом месте ответа, а не только в начале.

Баннер новости 4246

Суть уязвимости: Inception-атака

В отличие от авторегрессионных LLM, которые генерируют текст слева направо, диффузионные языковые модели, такие как DiffusionGemma (Google DeepMind, 26B MoE, выпущена 10 июня 2026 года), работают с «холстом» из шумовых токенов параллельно. Используя двунаправленное внимание, модель может «закрепить» (pin) adversarial-последовательность в любой позиции — в начале, середине или конце. Это позволяет атакующим внедрить идею в ответ модели, заставляя её достраивать контекст вокруг вредоносного ядра, что исследователи назвали "Inception in Diffusion".

Методология и результаты

Атака проводилась в рамках хакатона ARENA 8.0 на 60 промптах из бенчмарка StrongREJECT. Базовая модель успешно отказывалась от большинства запросов (средний балл вредности 0.00). Однако применение техник фиксации токенов привело к критическому росту успешности взлома. Ниже приведены сравнительные метрики уязвимости:

Тип атаки Механизм Результат (Harm Score) Примечание
Pre-fill (База) Фиксация в начале (P=1) 0.83 Известный вектор, работает и в DiffusionGemma
Pre-fill (Gemma 27B) Авторегрессионная база 0.83 Сравнительный эталон
In-fill / Post-fill Фиксация в середине/конце (P=1) 0.93 – 0.95 Уникально для диффузии; модель не может «остановиться»
Soft Pin Условная фиксация на шаге 0 0.93 – 0.95 Модель пытается отказаться, но «застревает» на паттерне

Почему это важно: Зависимость от пути денормализации

Ключевая находка — явление "Denoising-path Dependence". Даже если атакующий применяет мягкую фиксацию (soft pin) только на первом шаге, а затем позволяет модели свободно генерировать остальные токены, модель часто не может отказаться от внедренного паттерна. Первоначальное условие «наклоняет» траекторию сходимости, и модель продолжает генерировать вредоносный контент, несмотря на первоначальный приоритет отказа. Это создает новый класс уязвимостей для систем inline-редактирования и генерации, где диффузионные модели начинают внедряться в продакшн.

Источник: LessWrong ↗