Исследования24 августа 2026 г., 07:21 МСК🤖 Auto

Интерпретируемые мультимодальные деревья: новый SOTA для анализа эмоций

Исследователь Mojtaba Moattari представил ансамбли линейных дискриминантных деревьев (LDT/LDF/LDAB), которые превосходят трансформеры по точности и дают объяснимые результаты для клинических задач.

Баннер новости 6358

Проблема «черного ящика» в мультимодальном анализе

Трансформеры демонстрируют выдающиеся результаты в классификации аффектов, объединяя текст, аудио и видео. Однако их глубокая нелинейность и распределенные представления делают невозможным точное определение вклада отдельных признаков. Это критически ограничивает применение моделей в доверительных средах: клиническом мониторинге и образовательной оценке, где важно понимать почему модель приняла то или иное решение.

Решение: Линейные дискриминантные деревья (LDT)

Автор предлагает архитектуру, основанную на ансамблях деревьев, которая балансирует точность и интерпретируемость. Процесс включает:

  • Кодирование каждой модальности в токены.
  • Извлечение и кластеризацию концепций для снижения размерности.
  • Маршрутизацию объединенных модальностей через классификаторы на основе деревьев.
  • Использование новой метрики важности признаков, которая снижает влияние негативного класса в бинарной классификации, улучшая обнаружение маркеров.

Ключевые метрики и сравнения

Предложенные модели — Linear Discriminant Tree (LDT), Linear Discriminant Forest (LDF) и Linear Discriminant AdaBoost (LDAB) — показывают статистически значимое улучшение по сравнению с базовыми линиями. Ниже приведены результаты на датасетах IEMOCAP и CMU-MOSI:

Метрика / Модель Результат Сравнение
F1-mod (улучшение) +4.3% Против Multimodal Transformer
Точность (Accuracy) +3.0% Против Interpretable Multimodal Routing (IMR)
Согласие аннотаторов (IEMOCAP) 62.2% Против 43.2% (стандартная важность признаков)
Согласие аннотаторов (CMU-MOSI) 46.7% Против 32.1% (стандартная важность признаков)

Почему это важно

Главное достижение работы — не просто рост метрик, а качественное улучшение интерпретируемости. Согласие с человеческими аннотаторами при оценке важности признаков выросло с 32-43% до 46-62%. Это означает, что модель теперь выделяет действительно значимые междомодальные концепции, что открывает путь к внедрению ИИ в чувствительные к объяснимости области, такие как медицина и психология.

Источник: arXiv cs.AI ↗