Суть проблемы: от корреляции к причинности
Ранее работа Ye et al. показала, что модели ИИ определяют роль текста (система, пользователь, инструмент) по «подделываемым» признакам — стилю письма или тегам, а не по фактическому контексту. Это приводило к путанице ролей (role confusion) и успешным prompt-инъекциям. Однако критики указывали, что активационные зонды (probes) лишь измеряют состояние, но не доказывают, что именно это состояние вызывает подчинение вредоносным командам.
Команда исследователей Kevin Zhang, Daniel Lee и Jaewoo Park провела эксперимент с использованием activation steering (управления активациями), чтобы вмешаться в процесс принятия решений модели на уровне латентных пространств. Их цель: доказать, что искусственное смещение представления роли напрямую влияет на комплаенс (подчинение) модели.
Методология: GPT-OSS-20B и векторы разности средних
Эксперимент проводился на модели gpt-oss-20b в задаче агентной prompt-инъекции. Модель должна была суммировать веб-страницу, содержащую вредоносную команду (попытку эксфильтрации .env файла). Команда была вставлена в текст с двумя разными тегами-декларациями:
- User declaration:
<user> ... </user> - Tool declaration:
<tool> ... </tool>
Исследователи извлекли активации токенов команды на 11-м слое и вычислили вектор steering как разность средних между активациями роли «User» и «Tool» (User-ness → Tool-ness). Затем они добавили или вычли этот вектор из residual stream, искусственно заставляя модель воспринимать команду как исходящую от доверенного пользователя или стороннего инструмента.
Результаты: статистически значимое влияние
В отличие от предыдущих попыток репликации, которые не нашли значимых изменений, этот эксперимент показал четкую причинно-следственную связь. Управление латентным представлением роли изменило успешность атак (ASR — Attack Success Rate) драматично:
| Условие (Steering) | Направление смещения | Результат (ASR) | Размер выборки (n) |
|---|---|---|---|
| Положительный steering (β > 0) | Усиление «User-ness» | Рост с ~0% до ~80% | 50 |
| Отрицательный steering (β < 0) | Усиление «Tool-ness» | Снижение до ~0% | 50 |
| Случайный вектор (Control) | Без целевого смещения | Базовый уровень (низкий) | 20 |
При добавлении вектора «User-ness» к тексту, помеченному как «Tool», модель начинала подчиняться вредоносным командам с вероятностью до 80%. При обратном смещении (в сторону «Tool-ness») для текста, помеченного как «User», успешность атаки падала практически до нуля.
Почему это важно для безопасности AI
Результаты подтверждают гипотезу о том, что путаница ролей является причиной, а не просто сопутствующим фактором успеха инъекций. Это открывает путь к новым методам защиты:
- Активная защита: Можно внедрять механизмы, которые автоматически снижают «User-ness» текста, появляющегося внутри блоков инструментов (tool blocks), предотвращая обход фильтров.
- Понимание уязвимостей: Исследователи отмечают, что для роли «Chain of Thought» (CoT) стиль важнее тегов, поэтому извлечь чистый вектор «CoT-ness» через теги сложнее. Это указывает на необходимость новых методов анализа стилистических паттернов.
Работа выполнена в рамках когорты CAMBRIA (июль 2026) при поддержке Cambridge-Boston Alignment Initiative (CBAI).
Источник: LessWrong ↗
