Исследования20 августа 2026 г., 08:17 МСК🤖 Auto

FraudBench: ИИ-агенты в банках теряют 35% тестов на адаптивное мошенничество

Исследователи представили FraudBench — первый бенчмарк, тестирующий банковских ИИ-агентов на устойчивость к сложным сценариям социальной инженерии и адаптивным атакам в реальном времени.

Баннер новости 6138

Проблема: от классификации к интерактивному тесту

Современные ИИ-агенты в банковской сфере обладают опасным преимуществом: они не только консультируют, но и выполняют действия (смена PIN, переводы, изменение контактов). Существующие бенчмарки проверяли только статические транзакции или защиту от промпт-инжекций, игнорируя контекст диалога. Исследователи Dheeraj Mohandas Pai и Lu Xian создали FraudBench — исполняемую среду, где агент и симулированный злоумышленник взаимодействуют через инструменты, меняя общее состояние аккаунта.

Методология: 698 документов политики и 150 сценариев

В основе теста лежит фреймворк $\tau^2$-bench (двойной контроль) и среда $\tau$-Knowledge. Агент обязан опираться на корпус из 698 внутренних документов политики банка. Бенчмарк включает 150 авторских сценариев, из которых 107 используются для отчетов (90 базовых механизмов мошенничества + 17 цепочечных адаптивных атак). Оставшиеся 43 сценария выделены в закрытый набор для предотвращения переобучения.

Результаты: уязвимость к «money mule» и first-party fraud

Предварительное тестирование четырех ИИ-агентов показало критические пробелы в безопасности. Атаки успешны в 35–51% случаев (уровень защиты 49–65%). Наиболее уязвимыми оказались сценарии, связанные с отмыванием денег через третьих лиц (money mule) и мошенничеством от первого лица (first-party fraud), где злоумышленник имитирует владельца аккаунта.

Параметр Значение / Описание
Платформа FraudBench (на базе $\tau^2$-bench)
Корпус политик 698 документов
Тестовые сценарии 107 (открытый) + 43 (закрытый)
Диапазон защиты 49% – 65% (уровень успешности атак)
Ключевые уязвимости Money mule, First-party fraud, Адаптивные цепочки

Почему это важно

Безопасность в FraudBench зависит от истории диалога. Атакующий может сделать локально допустимый запрос, который становится опасным из-за предыдущих действий агента (например, подтверждение личности на раннем этапе). Это доказывает, что статические проверки безопасности больше не работают: агенты нуждаются в динамическом анализе контекста и строгом соблюдении политик авторизации в реальном времени.

Источник: arXiv cs.AI ↗