От статической уязвимости к динамическому поиску
Традиционные методы оценки безопасности LLM часто рассматривают успешность атаки как свойство самой модели, не зависящее от ресурсов. Авторы работы «Rethinking Indirect Prompt Injection as a Test-Time Search Problem» (arXiv:2609.04495) предлагают новую парадигму: косвенная инъекция промпта (IPI) — это не просто наличие бага, а задача поиска по поверхности атаки, зависящая от окружения, задачи пользователя и цели атаки.
Для проверки этой гипотезы команда разработала агентного атакующего (agentic attacker), оснащенного специализированным поисковым инструментарием. Этот агент не просто отправляет промпты, а проводит разведку окружения, строит структурированные стратегии и адаптируется на основе обратной связи от жертвы-агента.
Ключевые метрики и результаты
Эксперименты проводились на гетерогенных задачах с использованием агентов, обладающих доступом к инструментам. Главный вывод: увеличение вычислительного бюджета (test-time compute) у атакующего линейно улучшает обнаружение и эксплуатацию уязвимостей. Это опровергает идею о том, что модель можно «настроить и забыть» — безопасность зависит от того, сколько усилий готово приложить злоумышленник.
Абляционные исследования показали, что без явного управления стратегиями поиска атакующие быстро тратят ресурсы на дублирование попыток. Внедрение модуля управления стратегиями позволило поддерживать рост успешности атак даже при значительном увеличении бюджета.
| Параметр оценки | Наблюдение | Значение для индустрии |
|---|---|---|
| Зависимость от compute | Рост вычислений атакующего → рост успеха атаки | Статические тесты безопасности устарели; нужна оценка устойчивости к ресурсоемким атакам |
| Управление стратегиями | Критически важно для избежания редундантности | Агенты-защитники должны имитировать умный поиск, а не случайные обходы |
| Тип уязвимости | Indirect Prompt Injection (IPI) | Риск возникает из-за взаимодействия агента с внешним окружением, а не только из-за плохого промпта |
Почему это важно для разработчиков AI
Результаты исследования подчеркивают, что агентная безопасность (agentic security) требует нового подхода. Оценка должна характеризовать не только модель, но и процедуру поиска атакующего и его вычислительный бюджет. Игнорирование адаптивного поиска по поверхности атаки оставляет системы с инструментами (tool-using agents) критически уязвимыми, так как атакующие могут использовать большие вычислительные мощности для «пробивания» защиты методом систематического перебора и адаптации.
Источник: arXiv cs.AI ↗
