Проблема субъективности в XAI
Оценка качества объяснений, генерируемых методами объяснимого ИИ (XAI), долгое время опиралась на субъективное мнение людей. Это создавало барьеры для воспроизводимости, масштабируемости и сравнения результатов между различными исследованиями. Команда исследователей во главе с Yanfei Hu Fleischhauer и Stefan Feuerriegel предложила решение: использовать LLM в качестве объективных судей.
Что такое XAI-Arena
Авторы представили XAI-Arena — фреймворк для масштабируемой, воспроизводимой и многомерной оценки качества XAI-объяснений. Система позволяет сравнивать объяснения по восьми ключевым измерениям, учитывающим потребности различных стейкхолдеров:
- Воспринимаемая простота (Perceived simplicity)
- Ясность (Clarity)
- Адекватность задаче (Task adequacy)
- Калибровка доверия (Trust calibration)
- Практическая применимость (Actionability)
- Прозрачность (Transparency)
- Достоверность (Faithfulness)
- Общая интерпретируемость (Overall interpretability)
Результаты валидации
Ключевой вопрос исследования: могут ли LLM заменить человека в этой задаче? Для проверки авторы провели сравнение оценок, выставленных моделями, с оценками людей. Результаты показали сильную положительную корреляцию, что подтверждает состоятельность подхода.
| Метрика | Значение | Статистическая значимость |
|---|---|---|
| Spearman's rho | 0.693 | p < 0.001 |
Коэффициент 0.693 указывает на то, что LLM-судьи способны улавливать систематические различия в качестве объяснений, сопоставимые с человеческим восприятием.
Значение для индустрии
Внедрение XAI-Arena позволяет проводить бенчмаркинг XAI-методов на различных наборах данных и моделях без необходимости привлечения дорогостоящих человеческих ресурсов для каждого теста. Это открывает путь к стандартизации оценки «объяснимости» в ИИ, делая её такой же измеримой метрикой, как точность или F1-мера.
Источник: arXiv cs.AI ↗
