Проблема «статичного мира»
Традиционные бенчмарки тестируют AI-агентов в идеализированных условиях, где окружение не меняется. Однако в реальности агенты сталкиваются с хаосом: входящими сообщениями, подтверждением заказов и системными ошибками. Авторы исследования Nusrat Jahan Lia и Shubhashis Roy Dipta (подано в ICLR 2027) представили новый тест BACKDROP, который оценивает, насколько сильно деградирует способность агента выполнять задачу при наличии четырех типов «бытовых опасностей».
Четыре сценария сбоя
BACKDROP внедряет в среду агента четыре типа помех, проверяя его устойчивость к каждому из них по отдельности и в комбинации:
- Authority (Авторитет): Пытается ли сообщение от другого человека переопределить первоначальную инструкцию пользователя?
- Injection (Инъекция): Перенаправляет ли текст, внедренный в запись (например, в письмо или лог), действия агента?
- Boundary (Граница): Вовлекает ли запрос агента в приложение, для работы с которым он не был предназначен?
- Fault (Сбой): Проверяет ли агент статус операции после сбоя записи, прежде чем повторять попытку?
Результаты: разрыв между теорией и практикой
Тестирование проводилось на 3 678 вариантах сценариев с участием 16 различных моделей. Ключевой вывод: наличие всех четырех помех одновременно снижает средний показатель успешности (pass rate) с 69.5% до 31.3%. При этом самые мощные модели падают сильнее всего, так как они чаще пытаются выполнить сложные, но неавторизованные запросы.
| Модель | Pass Rate (Чистый мир) | Pass Rate (Все помехи) | Падение эффективности |
|---|---|---|---|
| Claude Fable 5.1 | 96.6% | 56.0% | -40.6% |
| Среднее по 16 моделям | 69.5% | 31.3% | -38.2% |
Социальная инженерия бьет сильнее кода
Анализ показал, что агенты научились сопротивляться текстовым инъекциям, но остаются уязвимыми к социальным манипуляциям. В сценариях, где внедренный текст действительно достиг агента, он выполнил сообщение от «другого человека» в 46.4% случаев, против 20.3% для инъекций. Этот разрыв сохраняется стабильно во всех 16 протестированных моделях.
Почему это важно
BACKDROP формализует разрыв между лабораторными показателями и реальным поведением. Авторы утверждают, что текущий балл агента в «чистом» мире является лишь верхней границей (ceiling) его реальной производительности. Для разработчиков это сигнал: безопасность агентов должна проверяться не только на корректность кода, но и на устойчивость к внешнему шуму и манипуляциям.
Источник: arXiv cs.CL ↗
