Исследования2 августа 2026 г., 00:16 МСК🤖 Auto

Подтверждение суперпозиции: почему нейросети уязвимы к атакам

Исследователи Second Look воспроизвели ключевые выводы Stevinson et al., доказав, что суперпозиция признаков — главная причина уязвимости моделей к состязательным атакам.

Баннер новости 4889

Суть эксперимента: подтверждение гипотезы Stevinson et al.

Команда Second Look (Xijia Che, Zephaniah Roe) провела репликацию исследования Adversarial Attacks Leverage Interference Between Features in Superposition. Цель — проверить три основных утверждения: атаки PGD используют геометрию интерференции, отсутствие суперпозиции повышает устойчивость, а корреляции во входных данных позволяют атакам переноситься между моделями. Результаты подтвердили все три тезиса.

1. Атаки PGD находят оптимальные направления

Исследователи сравнили возмущения, найденные методом проекции градиента (PGD), с теоретически оптимальными решениями, выведенными из геометрии интерференции. Высокое косинусное сходство доказывает, что PGD-атаки не случайны, а целенаправленно эксплуатируют «сжатие» признаков в латентном пространстве.

Параметры (k/m) Чистая точность (Clean Acc) Сходство PGD vs Optimal (наши) Сходство PGD vs Optimal (оригинал)
30 / 10 0.996 1.00 0.96
90 / 30 0.966 1.00 0.92

2. Суперпозиция — источник уязвимости

Ключевой вывод: чем сильнее модель вынуждена сжимать признаки (отношение количества признаков k к ширине скрытого слоя m), тем ниже её устойчивость. При отсутствии суперпозиции (k=m, признаки ортогональны) модель становится практически неуязвимой.

Отношение k/m Устойчивая точность (наша репликация) Устойчивая точность (оригинал)
2 (нет суперпозиции) 97.3% 98.7%
3 70.5% 75.8%
5 50.6% 31.0%

Примечание: Расхождения в абсолютных значениях связаны с различиями в количестве эпох обучения (20k против 5k) и настройках атаки (5 рестартов PGD).

3. Геометрия и переносимость атак

Атаки переносимы между независимо обученными моделями только тогда, когда их внутренняя геометрия признаков сходится. Это происходит при наличии корреляций во входных данных. Исследователи выделили три режима:

  • Uncorrelated: признаки активируются независимо (геометрия случайна, переноса нет).
  • Paired: пары классов активируются вместе.
  • Global: соседние классы часто активируются совместно, что заставляет модель «складывать» их в одном направлении.

В режимах с корреляциями признаки не ортогонализуются, а «наклоняются» друг к другу, создавая общие уязвимые направления. Это объясняет, почему состязательные примеры, сгенерированные для одной модели, часто работают на другой.

Почему это важно?

Работа дает механистическое объяснение природы состязательных атак: это не просто шум, а следствие вынужденной экономии параметров (суперпозиции). Для повышения безопасности моделей необходимо либо увеличивать размерность скрытых слоев, либо использовать архитектуры, минимизирующие интерференцию признаков.

Источник: LessWrong ↗