Конец эры линейной объяснимости
Традиционные модели машинного обучения, такие как логистическая регрессия или градиентный бустинг, позволяют использовать метод SHAP (SHapley Additive exPlanations) для объяснения каждого решения. Мы видим, какой признак (например, сумма транзакции или геолокация) повлиял на отказ в обслуживании. Однако с приходом Agentic AI (автономных агентов) эта парадигма рушится. Агенты не просто классифицируют данные — они действуют, взаимодействуют с другими системами и принимают решения на основе цепочек событий, которые невозможно свести к линейному весу одного признака.
Почему SHAP не работает с агентами?
Проблема заключается в природе принятия решений. Автономный агент может:
- Запустить несколько параллельных запросов к внешним API для верификации.
- Изменить контекст диалога с клиентом на основе промежуточных результатов.
- Принять финальное решение (блокировка/разблокировка) на основе состояния всей системы, а не одной транзакции.
SHAP требует статического набора входных признаков. В случае с агентом «входные данные» — это динамический процесс, где причина и следствие переплетены. Попытка применить SHAP к такому процессу дает ложное чувство безопасности: модель может показать, что «сумма транзакции» была важным фактором, но проигнорирует тот факт, что агент проигнорировал предупреждение от другой системы из-за ошибки в логике планирования.
Новая архитектура рисков
Фрод-мониторинг переходит от детекции аномалий к детекции поведенческих паттернов агентов. Злоумышленники могут начать атаковать не саму модель, а цепочку рассуждений агента (Chain of Thought), вызывая сбой в его логике. Если мы не можем объяснить, почему агент принял решение, мы не можем проверить, не был ли он манипулирован.
| Критерий | Традиционные ML-модели | Agentic AI (Автономные агенты) |
|---|---|---|
| Механизм решения | Статический прогноз на основе признаков | Динамическая цепочка действий и рассуждений |
| Инструмент объяснимости | SHAP, LIME (локальные веса) | Логирование траектории (Trace), аудит действий |
| Уязвимостьtd> | Подмена признаков (Adversarial attacks) | Отравление контекста, манипуляция планированием |
| Прозрачность | Высокая (почему был сделан вывод) | Низкая (почему был выбран такой путь действий) |
Что делать индустрии?
Разработчикам фрод-систем необходимо отказаться от поиска «виноватого признака» в пользу аудита процессов. Ключевым инструментом становится не объяснение веса фичи, а воспроизведение полного лога взаимодействий агента с окружением. Без этого регуляторы и внутренние комитеты по рискам не смогут одобрить использование автономных агентов в критических финансовых операциях.
Источник: Towards Data Science ↗
