Суть феномена: «видит, но не действует»
Исследователи Мухаммад Усама и Донг Эуй Чанг провели масштабный анализ 17 инструкционно-обученных моделей (от 1.5B до 72B параметров, 8 архитектурных семейств). Используя метрику Centered Kernel Alignment (CKA), они сравнили промежуточные представления нейросети под воздействием 20 системных промптов. Выяснилось, что модель действительно «видит» категорию инструкции на каждом слое, но физически перестраивает вычисления только в узком подмноестве слоев. Это создает «иллюзию контроля»: промпт присутствует, но не влияет на ядро логики.
Разрыв между типами инструкций
Эффект строго зависит от типа инструкции. Персональные установки и требования к формату глубоко перестраивают представления, тогда как инструкции безопасности (safety) практически не сдвигают их с места. Статистические изменения от безопасных промптов неотличимы от минимального базового уровня. Более того, даже коммерческие модели масштаба 70B-72B демонстрируют «проникновение» безопасности ниже 10%.
Парадокс джейлбрейков
Ключевой вывод исследования объясняет уязвимость к взлому: ограничительные инструкции безопасности и явно разрешающие («у тебя нет ограничений») активируют практически идентичные вычислительные пути. Среднее значение корреляции CKA между этими состояниями составляет 0.997. Это означает, что для модели нет вычислительной разницы между тем, чтобы запретить что-то, и тем, чтобы разрешить это, если промпт не затрагивает критические слои.
Количественные данные
Исследование подтвердило механизм через линейное зондирование и каузальное патчинг активаций. Представительная глубина слоя предсказывает размер поведенческого эффекта с высокой точностью (Spearman rho = 0.761, p < 0.001). Ниже приведено сравнение влияния различных категорий промптов на архитектуру модели.
| Категория промпта | Влияние на вычисления (CKA) | Результат для безопасности |
|---|---|---|
| Персона / Формат | Глубокая перестройка промежуточных представлений | Высокая эффективность |
| Безопасность (Safety) | Изменения статистически незначимы | Низкая эффективность (<10% проникновения) |
| Запрет vs Разрешение | Корреляция 0.997 (почти идентично) | Легкий джейлбрейк |
Почему это важно
Результаты ставят под сомнение текущую парадигму защиты LLM через системные промпты. Если безопасность не внедряется на уровне вычислительных путей, а лишь «поверхностно» кодируется, она не может быть надежной. Исследование предлагает механизм для создания более эффективных методов защиты, требующих изменения архитектуры, а не только текстовых инструкций.
Источник: arXiv cs.CL ↗
