Проблема: Отсутствие систематизации сбоев AI-агентов
По мере того как AI-агенты всё чаще действуют через инструменты и получают делегированные полномочия, возникает критическая потребность в анализе их отказов. Существующие репозитории инцидентов часто не содержат механизмов, необходимых для сравнения публичных сбоев с оценками безопасности агентов. Исследователи из Индии (Divyanshu Kumar, Rohith HN, Nitin Aravind Birur, Sahil Agarwal, Prashanth Harshangi) предлагают решение — Agent Incident Registry (AIR).
Что такое AIR: Структура и метрики
AIR — это каталог, связанный с источниками, содержащий записи об инцидентах, связанных с AI-агентами. Каждая запись включает:
- Подтверждающие доказательства (source-linked evidence).
- Стабильный идентификатор (stable identifier).
- Метки, учитывающие неполноту данных (missingness-aware labels), которые классифицируют:
- Причинную роль (causal role).
- Класс раскрытия информации (disclosure class).
- Механизм сбоя (mechanism).
- Итог (outcome).
Ключевые выводы исследования
Анализ показывает, что реализованный вред (realized harm) концентрируется в инцидентах, произошедших в реальных условиях (in-the-wild), и сбоях безопасности. В то же время ответственные раскрытия и демонстрации исследований преобладают в категории «демонстрация», что характеризует состав выборки, а не реальный риск развертывания.
Валидация и аудит
После первоначальной кураторской обработки все записи и их метки были проверены вторым человеком-рецензентом на полноту и корректность. В аудите, имитирующем развертывание, исследователи отметили, что случаи, связанные с инструментом InjecAgent, занимают три из двенадцати поверхностей AIR и все они инициированы злоумышленником. При этом AIR содержит 0 случаев сбоев безопасности без участия злоумышленника (no-adversary safety failures) в данном контексте сравнения.
Значение для индустрии
AIR поддерживает извлечение случаев, основанное на источниках, и аудит области оценки. Важно отметить, что система предназначена не для оценки частоты отказов или эффективности контроля, а для предотвращения повторных сбоев через глубокое понимание механизмов их возникновения.
Источник: arXiv cs.AI ↗
