Суть эксперимента: подтверждение гипотезы Stevinson et al.
Команда Second Look (Xijia Che, Zephaniah Roe) провела репликацию исследования Adversarial Attacks Leverage Interference Between Features in Superposition. Цель — проверить три основных утверждения: атаки PGD используют геометрию интерференции, отсутствие суперпозиции повышает устойчивость, а корреляции во входных данных позволяют атакам переноситься между моделями. Результаты подтвердили все три тезиса.
1. Атаки PGD находят оптимальные направления
Исследователи сравнили возмущения, найденные методом проекции градиента (PGD), с теоретически оптимальными решениями, выведенными из геометрии интерференции. Высокое косинусное сходство доказывает, что PGD-атаки не случайны, а целенаправленно эксплуатируют «сжатие» признаков в латентном пространстве.
| Параметры (k/m) | Чистая точность (Clean Acc) | Сходство PGD vs Optimal (наши) | Сходство PGD vs Optimal (оригинал) |
|---|---|---|---|
| 30 / 10 | 0.996 | 1.00 | 0.96 |
| 90 / 30 | 0.966 | 1.00 | 0.92 |
2. Суперпозиция — источник уязвимости
Ключевой вывод: чем сильнее модель вынуждена сжимать признаки (отношение количества признаков k к ширине скрытого слоя m), тем ниже её устойчивость. При отсутствии суперпозиции (k=m, признаки ортогональны) модель становится практически неуязвимой.
| Отношение k/m | Устойчивая точность (наша репликация) | Устойчивая точность (оригинал) |
|---|---|---|
| 2 (нет суперпозиции) | 97.3% | 98.7% |
| 3 | 70.5% | 75.8% |
| 5 | 50.6% | 31.0% |
Примечание: Расхождения в абсолютных значениях связаны с различиями в количестве эпох обучения (20k против 5k) и настройках атаки (5 рестартов PGD).
3. Геометрия и переносимость атак
Атаки переносимы между независимо обученными моделями только тогда, когда их внутренняя геометрия признаков сходится. Это происходит при наличии корреляций во входных данных. Исследователи выделили три режима:
- Uncorrelated: признаки активируются независимо (геометрия случайна, переноса нет).
- Paired: пары классов активируются вместе.
- Global: соседние классы часто активируются совместно, что заставляет модель «складывать» их в одном направлении.
В режимах с корреляциями признаки не ортогонализуются, а «наклоняются» друг к другу, создавая общие уязвимые направления. Это объясняет, почему состязательные примеры, сгенерированные для одной модели, часто работают на другой.
Почему это важно?
Работа дает механистическое объяснение природы состязательных атак: это не просто шум, а следствие вынужденной экономии параметров (суперпозиции). Для повышения безопасности моделей необходимо либо увеличивать размерность скрытых слоев, либо использовать архитектуры, минимизирующие интерференцию признаков.
Источник: LessWrong ↗
