Проблема непрозрачности ИИ
В высокорисковых сферах (медицина, финансы) ML-модели часто работают как «черные ящики». Существующие методы пост-хок объяснений (post-hoc explainers) требуют от экспертов глубоких знаний для интерпретации многомерных данных и выбора лучших инструментов. Авторы работы, опубликованной в arXiv (1 октября 2026 г.), предлагают решение, снимающее этот барьер: систему MEA (Multi-Agent Explanation), где ИИ-агенты берут на себя всю техническую работу по генерации понятных человеку объяснений.
Архитектура MEA: Proposer и Actor
Система состоит из двух ключевых агентов, работающих в связке:
- Proposer (Предложитель): Анализирует вопрос и модальность данных (таблицы, текст, изображения), чтобы выбрать и настроить оптимальный набор инструментов объяснения.
- Actor (Исполнитель): Оптимизируется end-to-end на основе метрики «достоверности» (faithfulness). Он трансформирует технические выводы моделей в естественный язык, гарантируя, что объяснение точно отражает поведение ИИ.
Результаты: Превосходство над базовыми моделями
Исследователи обнаружили, что даже передовые LLM систематически генерируют недостоверные объяснения. Оптимизация MEA против наград за достоверность (с модально-адаптивными штрафами) дала значительный прирост метрик по сравнению с необученным бэкбондом и существующими методами. Сравнение эффективности представлено ниже:
| Модальность данных | Прирост достоверности (Faithfulness Gain) | Сравнение с базой |
|---|---|---|
| Табличные данные (Tabular) | +28% | Превосходит post-hoc explainers и закрытые модели |
| Текст (Text) | +21% | Превосходит post-hoc explainers и закрытые модели |
| Изображения (Vision) | +34% | Превосходит post-hoc explainers и закрытые модели |
Значение для индустрии
MEA тестируется на шести наборах данных и охватывает три типа вопросов: атрибуция признаков, контрфактическое рассуждение и обнаружение ложных (spurious) признаков. Работа доказывает, что ИИ-агенты могут стать масштабируемым интерфейсом для объяснимости ИИ (XAI), заменяя узкоспециализированные инструменты универсальным решением на естественном языке.
Источник: arXiv cs.AI ↗
