Исследования5 октября 2026 г., 12:19 МСК🤖 Auto

MEA: ИИ-агенты генерируют объяснения моделей с точностью до 34%

Исследователи представили MEA — многоагентную систему, которая использует подкрепляющее обучение для создания достоверных объяснений работы ML-моделей, устраняя разрыв между сложными алгоритмами и пользователями.

Баннер новости 8937

Проблема непрозрачности ИИ

В высокорисковых сферах (медицина, финансы) ML-модели часто работают как «черные ящики». Существующие методы пост-хок объяснений (post-hoc explainers) требуют от экспертов глубоких знаний для интерпретации многомерных данных и выбора лучших инструментов. Авторы работы, опубликованной в arXiv (1 октября 2026 г.), предлагают решение, снимающее этот барьер: систему MEA (Multi-Agent Explanation), где ИИ-агенты берут на себя всю техническую работу по генерации понятных человеку объяснений.

Архитектура MEA: Proposer и Actor

Система состоит из двух ключевых агентов, работающих в связке:

  • Proposer (Предложитель): Анализирует вопрос и модальность данных (таблицы, текст, изображения), чтобы выбрать и настроить оптимальный набор инструментов объяснения.
  • Actor (Исполнитель): Оптимизируется end-to-end на основе метрики «достоверности» (faithfulness). Он трансформирует технические выводы моделей в естественный язык, гарантируя, что объяснение точно отражает поведение ИИ.

Результаты: Превосходство над базовыми моделями

Исследователи обнаружили, что даже передовые LLM систематически генерируют недостоверные объяснения. Оптимизация MEA против наград за достоверность (с модально-адаптивными штрафами) дала значительный прирост метрик по сравнению с необученным бэкбондом и существующими методами. Сравнение эффективности представлено ниже:

Модальность данных Прирост достоверности (Faithfulness Gain) Сравнение с базой
Табличные данные (Tabular) +28% Превосходит post-hoc explainers и закрытые модели
Текст (Text) +21% Превосходит post-hoc explainers и закрытые модели
Изображения (Vision) +34% Превосходит post-hoc explainers и закрытые модели

Значение для индустрии

MEA тестируется на шести наборах данных и охватывает три типа вопросов: атрибуция признаков, контрфактическое рассуждение и обнаружение ложных (spurious) признаков. Работа доказывает, что ИИ-агенты могут стать масштабируемым интерфейсом для объяснимости ИИ (XAI), заменяя узкоспециализированные инструменты универсальным решением на естественном языке.

Источник: arXiv cs.AI ↗