Проблема «слепых зон» в мультимодальном ИИ
Большинство современных систем анализа настроений (Sentiment Analysis) работают в идеальных условиях, предполагая наличие полных наборов данных: текста, аудио и видео. Однако в реальных сценариях (например, при плохом качестве связи или повреждении файлов) одна или несколько модальностей часто оказываются недоступными. Существующие методы решения этой проблемы, основанные на импутации (восстановлении) данных, часто теряют семантическую связь между сигналами, что снижает общую точность модели.
Решение: Архитектура MIDAS
Исследователи представили MIDAS (Mutual Information Disentanglement with Uncertainty-Aware fuSion) — фреймворк, принятый к публикации в IEEE TPAMI 2026. Ключевая инновация заключается в отказе от простой «заплатки» пропущенных данных. Вместо этого MIDAS использует вариационное моделирование, представляя каждую модальность через многомерные гауссовы латентные переменные. Эти переменные разлагаются на две части:
- Общие факторы (Shared): Семантическая информация, общая для всех модальностей (смысл высказывания).
- Эксклюзивные факторы (Exclusive): Уникальные признаки конкретной модальности (интонация, мимика).
Механизм работы: Разделение и Взвешивание
Для стабильного разделения информации применяется минимаксная цель (minimax objective): модель минимизирует взаимную информацию между общими и эксклюзивными пространствами, чтобы избежать «утечки» признаков, и максимизирует взаимную информацию между общими пространствами разных модальностей для усиления семантической согласованности.
Критически важным элементом является механизм слияния, учитывающий неопределенность (uncertainty-aware fusion). Модель использует апостериорную дисперсию как индикатор надежности. Если одна из модальностей повреждена или отсутствует, ее дисперсия возрастает, и система автоматически снижает вес этого сигнала при финальном слиянии, опираясь на оставшиеся надежные данные.
Результаты и значимость
Эксперименты MIDAS проводились на трех широко используемых наборах данных. Результаты демонстрируют стабильное и значимое превосходство над конкурентными базовыми моделями в широком диапазоне сценариев с неполными данными. Это открывает путь к созданию более надежных систем распознавания эмоций для телемедицины, анализа соцсетей и систем безопасности, где качество входных данных часто нестабильно.
Источник: arXiv cs.AI ↗
