Анатомия SpikeGPT: RWKV и спайковые нейроны
В центре разбора — модель SpikeGPT (216 млн параметров), построенная на базе архитектуры RWKV. Это гибридная система: она обучается параллельно, как Transformer, но выполняется последовательно, как RNN, что снижает вычислительную сложность с O(N²) до O(N). Ключевая особенность — использование спайковых нейронных сетей (SNN). Нейроны здесь не передают непрерывные значения, а генерируют бинарные импульсы (спайки) при достижении порога. Это делает сеть разреженной и событийно-управляемой, что критически важно для тестирования устойчивости представлений к дискретизации.
Ошибка метрики 9.7: Сдвиг ≠ Сохранение
В предыдущих работах автор использовал коэффициент отношения сдвига центроидов к изменению разброса (около 9.7) как доказательство того, что классы данных просто «переместились» (relocation), а не «схлопнулись» (collapse). Однако новый анализ показал, что эта метрика фундаментально невалидна. Можно создать два сценария с идентичными геометрическими параметрами:
- Релокация: Облака данных поворачиваются как жесткие объекты, сохраняя форму и разделимость, но меняя местами позиции.
- Коллапс: Облака сдвигаются к общему центру, полностью сливаясь в одну точку, теряя различимость.
В обоих случаях отношение сдвига к деформации может быть одинаковым (или даже бесконечным), но результат для информации кардинально различен. Метрика игнорирует топологию, а не только геометрию.
Новый стандарт: Метрика a-fresh
Единственный надежный способ отличить сохранение информации от её потери — это не измерять координаты, а проверять функциональность. Автор вводит метрику a-fresh (accuracy from scratch): после атаки на скрытый канал обучается новый классификатор-монитор с нуля на измененных данных.
| Метрика | Что измеряет | Результат для SpikeGPT | Вывод |
|---|---|---|---|
| Отношение сдвига (Shift/Spread) | Геометрическое перемещение центроидов | Нестабильно (6.7–7.2), не коррелирует с разделением | Невалидно для оценки целостности данных |
| a-fresh (Accuracy) | Способность нового монитора восстановить классы | 100% точность в каждом раунде | Классы сохранены, канал работает через перемещение, а не слияние |
Почему это важно для AI-безопасности
Результаты показывают, что в спайковых сетях (SNN) скрытые каналы могут быть крайне устойчивы. Атакующий (Alice) не просто маскирует сигнал, а перестраивает геометрию латентного пространства так, что структура различимости классов остается нетронутой, хотя и смещенной. Это означает, что стандартные методы обнаружения, основанные на анализе статистических отклонений или «размазанности» данных, могут быть обмануты. Для разработчиков нейроинтерфейсов и систем безопасности это сигнал: нужно переходить от геометрического мониторинга к функциональному тестированию (retraining-based verification).
Источник: LessWrong ↗
