Проблема «черного ящика» в мультимодальном анализе
Трансформеры демонстрируют выдающиеся результаты в классификации аффектов, объединяя текст, аудио и видео. Однако их глубокая нелинейность и распределенные представления делают невозможным точное определение вклада отдельных признаков. Это критически ограничивает применение моделей в доверительных средах: клиническом мониторинге и образовательной оценке, где важно понимать почему модель приняла то или иное решение.
Решение: Линейные дискриминантные деревья (LDT)
Автор предлагает архитектуру, основанную на ансамблях деревьев, которая балансирует точность и интерпретируемость. Процесс включает:
- Кодирование каждой модальности в токены.
- Извлечение и кластеризацию концепций для снижения размерности.
- Маршрутизацию объединенных модальностей через классификаторы на основе деревьев.
- Использование новой метрики важности признаков, которая снижает влияние негативного класса в бинарной классификации, улучшая обнаружение маркеров.
Ключевые метрики и сравнения
Предложенные модели — Linear Discriminant Tree (LDT), Linear Discriminant Forest (LDF) и Linear Discriminant AdaBoost (LDAB) — показывают статистически значимое улучшение по сравнению с базовыми линиями. Ниже приведены результаты на датасетах IEMOCAP и CMU-MOSI:
| Метрика / Модель | Результат | Сравнение |
|---|---|---|
| F1-mod (улучшение) | +4.3% | Против Multimodal Transformer |
| Точность (Accuracy) | +3.0% | Против Interpretable Multimodal Routing (IMR) |
| Согласие аннотаторов (IEMOCAP) | 62.2% | Против 43.2% (стандартная важность признаков) |
| Согласие аннотаторов (CMU-MOSI) | 46.7% | Против 32.1% (стандартная важность признаков) |
Почему это важно
Главное достижение работы — не просто рост метрик, а качественное улучшение интерпретируемости. Согласие с человеческими аннотаторами при оценке важности признаков выросло с 32-43% до 46-62%. Это означает, что модель теперь выделяет действительно значимые междомодальные концепции, что открывает путь к внедрению ИИ в чувствительные к объяснимости области, такие как медицина и психология.
Источник: arXiv cs.AI ↗
