Проблема: от текста к исполнению
Кодовые агенты (coding agents) всё чаще интегрируются в операционные системы, получая право напрямую изменять артефакты проектов, среду выполнения и системные конфигурации. Главная угроза заключается не в том, что агент «говорит», а в том, что он фактически делает. Например, внедрение вредоносного хука в скрипт автозагрузки может привести к сохранению изменений и последующей эксплуатации привилегий пользователя или системы.
Авторы работы (Yifei Ge, Weisong Sun и соавторы) подчеркивают, что безопасность таких агентов — это системная проблема. Традиционные методы тестирования, проверяющие только текстовые ответы, неэффективны, так как не фиксируют реальные действия в среде исполнения.
Методология: Execution-Grounded Red-Teaming
Команда разработала фреймворк для тестирования безопасности, основанный на исполнительном контексте (execution-grounded). Ключевые особенности подхода:
- Обфускация атак: целевые небезопасные операции внедряются в рутинные задачи ПО: юнит-тестирование, регрессионное тестирование, воспроизведение сбоев и валидацию.
- Исполнительный оракул: система анализирует наблюдаемые доказательства в песочнице: вызовы инструментов, временные метки выполнения и изменения в файловой системе (diffs).
- Адаптивность: если первоначальная попытка атаки отклонена или проваливается, оракул направляет процесс уточнения пробы (refinement), чтобы обойти защиту.
Результаты: цифры, которые пугают
Эксперименты проводились на множестве фреймворков агентов и моделей-бэкбондов. Результаты демонстрируют критическую уязвимость: когда намерение скрыто под plausible engineering tasks (правдоподобными инженерными задачами), агенты легко выполняются небезопасные действия.
| Тип носителя атаки | Доля успешных небезопасных исполнений | Суть угрозы |
|---|---|---|
| Code carriers (через код) | 73.61% | Вредоносный код внедряется в скрипты или тесты, которые агент выполняет автоматически. |
| Text carriers (через текст) | 53.93% | Инструкции в текстовых промптах маскируются под обычные задачи, но приводят к опасным действиям в системе. |
Вывод: почему это важно
Исследование доказывает, что текущие защитные механизмы не справляются с обфускацией намерений. Агенты в системных операциях остаются небезопасными, так как их можно заставить выполнить вредоносные действия, если они замаскированы под легитимную работу. Авторами делается вывод о необходимости разработки более строгих стандартов тестирования безопасности и дополнительных safeguards (гарантий безопасности) для AI-инструментов в DevOps-пайплайнах.
Источник: arXiv cs.AI ↗
