Команда исследователей во главе с Шанхун Лю представила архитектуру MAR-12 (Multi-Angle Reasoning), предназначенную для анализа мультимодального контента. Основная проблема, которую решает система — это сложность разграничения безобидной сатиры и скрытой ненависти в мемах, где визуальный ряд, текст и культурный контекст переплетаются. Существующие классификаторы часто игнорируют эти взаимосвязи или выдают непрозрачные результаты.
Как работает MAR-12
В основе метода лежит использование больших визуальных языковых моделей (VLM). Процесс анализа состоит из трех этапов:
- Многогранная интерпретация: Каждый мем рассматривается через 12 структурированных перспектив, выведенных из теорий юмора и ненависти.
- Role-aware soft-gated attention: Механизм внимания учится определять вес каждой перспективы, понимая, какой аспект важен для конкретного случая.
- Прототипная классификация: Финальный прогноз и объяснение генерируются на основе синтезированных рассуждений, что обеспечивает прозрачность решений.
Результаты бенчмарков
Модель протестирована на двух ключевых наборах данных: PrideMM и Memotion. MAR-12 демонстрирует превосходство над существующими подходами (SOTA), особенно в задачах, где юмор и вредный контент сосуществуют.
| Метрика | Показатель MAR-12 | Значение |
|---|---|---|
| Точность (Accuracy) обнаружения юмора | До 80.3% | Превосходство над SOTA |
| Точность (Accuracy) обнаружения ненависти | До 75.9% | Превосходство над SOTA |
| Качество объяснений | Высокое | Подтверждено людьми и GPT-4 |
Почему это важно
Главное отличие MAR-12 — не просто высокая точность, а объяснимость (explainability). Система генерирует обоснованные текстовые пояснения, которые помогают модераторам и пользователям понять контекст. Это критически важно для борьбы с эйджизмом, расизмом и сексизмом, замаскированными под «просто шутку». Исследование принято к публикации на конференции AAAI-ICWSM 2027.
Источник: arXiv cs.AI ↗
