Исследования15 июля 2026 г., 00:18 МСК🤖 Auto

SpikeGPT: Почему метрика «сдвига» обманывает при анализе скрытых каналов

Исследователь IgorPereverzevDev разбирает архитектуру нейросети SpikeGPT и доказывает, что старый метод оценки скрытых каналов (covert channels) через геометрический сдвиг классов невалиден. Введение новой метрики a-fresh показывает, что информация м

Баннер новости 3577

Анатомия SpikeGPT: RWKV и спайковые нейроны

В центре разбора — модель SpikeGPT (216 млн параметров), построенная на базе архитектуры RWKV. Это гибридная система: она обучается параллельно, как Transformer, но выполняется последовательно, как RNN, что снижает вычислительную сложность с O(N²) до O(N). Ключевая особенность — использование спайковых нейронных сетей (SNN). Нейроны здесь не передают непрерывные значения, а генерируют бинарные импульсы (спайки) при достижении порога. Это делает сеть разреженной и событийно-управляемой, что критически важно для тестирования устойчивости представлений к дискретизации.

Ошибка метрики 9.7: Сдвиг ≠ Сохранение

В предыдущих работах автор использовал коэффициент отношения сдвига центроидов к изменению разброса (около 9.7) как доказательство того, что классы данных просто «переместились» (relocation), а не «схлопнулись» (collapse). Однако новый анализ показал, что эта метрика фундаментально невалидна. Можно создать два сценария с идентичными геометрическими параметрами:

  • Релокация: Облака данных поворачиваются как жесткие объекты, сохраняя форму и разделимость, но меняя местами позиции.
  • Коллапс: Облака сдвигаются к общему центру, полностью сливаясь в одну точку, теряя различимость.

В обоих случаях отношение сдвига к деформации может быть одинаковым (или даже бесконечным), но результат для информации кардинально различен. Метрика игнорирует топологию, а не только геометрию.

Новый стандарт: Метрика a-fresh

Единственный надежный способ отличить сохранение информации от её потери — это не измерять координаты, а проверять функциональность. Автор вводит метрику a-fresh (accuracy from scratch): после атаки на скрытый канал обучается новый классификатор-монитор с нуля на измененных данных.

Метрика Что измеряет Результат для SpikeGPT Вывод
Отношение сдвига (Shift/Spread) Геометрическое перемещение центроидов Нестабильно (6.7–7.2), не коррелирует с разделением Невалидно для оценки целостности данных
a-fresh (Accuracy) Способность нового монитора восстановить классы 100% точность в каждом раунде Классы сохранены, канал работает через перемещение, а не слияние

Почему это важно для AI-безопасности

Результаты показывают, что в спайковых сетях (SNN) скрытые каналы могут быть крайне устойчивы. Атакующий (Alice) не просто маскирует сигнал, а перестраивает геометрию латентного пространства так, что структура различимости классов остается нетронутой, хотя и смещенной. Это означает, что стандартные методы обнаружения, основанные на анализе статистических отклонений или «размазанности» данных, могут быть обмануты. Для разработчиков нейроинтерфейсов и систем безопасности это сигнал: нужно переходить от геометрического мониторинга к функциональному тестированию (retraining-based verification).

Источник: LessWrong ↗