Проблема «слепой верности» (Fidelity)
Традиционная оценка методов объяснимого ИИ (XAI) опирается на метрику fidelity (верность). Она измеряет, насколько хорошо объяснение воспроизводит предсказания черной коробки. Однако авторы работы Miquel Miró-Nicolau, Francesco Spinnato и Riccardo Guidotti (24 сентября 2026 г.) показывают, что это критический недостаток: высокая верность не гарантирует, что объяснение отражает реальный процесс принятия решений моделью. Разные, даже противоречивые объяснения могут иметь одинаковый высокий балл fidelity, вводя пользователей в заблуждение.
Решение: Синтетический Ground-Truth
Ученые предлагают фреймворк, основанный на синтетических данных с известным ground truth. Используя контролируемые вмешательства (interventions), они генерируют датасеты, где важность каждого признака задана алгоритмически. Это позволяет сравнить объяснение модели с «истинным» ответом, а не просто с выходом модели.
Результаты тестирования 9 методов
Фреймворк протестирован на трех доменах: бинарные изображения, табличные данные и временные ряды. Эксперименты выявили серьезные ограничения у широко используемых методов. Ниже приведена сводка выявленных проблем в зависимости от типа данных:
| Домен данных | Ключевая проблема выявленных методов | Суть ошибки |
|---|---|---|
| Бинарные изображения | Несоответствие семантике | Методы выделяют шум или артефакты, а не объекты, определяющие класс, несмотря на высокую fidelity. |
| Табличные данные | Игнорирование взаимодействий | Многие методы (например, простые SHAP-аппроксимации) не учитывают нелинейные связи между признаками, давая ложную важность отдельным столбцам. |
| Временные ряды | Запаздывание причинности | Объяснения часто привязываются к корреляциям, а не к причинно-следственным точкам во времени, что критично для прогнозирования. |
Почему это важно
Работа подчеркивает необходимость перехода от оценки «совпадения с выходом» к оценке «совпадения с логикой». Без синтетических бенчмарков с известным ground truth мы не можем быть уверены, что доверяем объяснениям критически важных систем (медицина, финансы). Авторы призывают сообщество использовать их фреймворк как новый стандарт валидации XAI-методов.
Источник: arXiv cs.AI ↗
