Исследования7 августа 2026 г., 16:18 МСК🤖 Auto

C³PO: Почему мультимодальные ИИ игнорируют видео и аудио

Новый бенчмарк C³PO выявил критический дефект в работе топовых омнимодальных моделей: они «залипают» на тексте, игнорируя противоречивые визуальные и звуковые данные.

Баннер новости 5309

Проблема доминирования модальности

Многие считают, что современные мультимодальные большие языковые модели (MLLM) умеют полноценно понимать мир, объединяя текст, изображения, видео и аудио. Однако исследование C³PO (Cross-Modal Composition and Counterfactual Performance) от авторов Swapnanil Mukherjee, Agyeya Negi, Tanuja Ganu и Ponnurangam Kumaraguru доказывает обратное. Модели страдают от «хрупкого» кросс-модального рассуждения: они принимают решения, опираясь преимущественно на один доминирующий канал, обычно текст, и игнорируют противоречащие ему данные из других источников.

Методология: 3 404 тестовых случая

Авторы создали автоматизированный пайплайн на основе 25 логически выверенных шаблонов, сгенерировав датасет из 3 404 примеров. Тестирование фокусируется на двух ключевых способностях:

  • Composition (IC): Умение синтезировать разрозненные доказательства из разных модальностей.
  • Counterfactual Conflict (CC): Способность разрешать намеренные противоречия между модальностями (например, когда текст описывает одно событие, а видео показывает другое).

Результаты: разрыв с человеком и провал open-source

Сравнение показывает, что даже лучшие коммерческие модели значительно уступают людям в разрешении конфликтов. Люди достигают точности 88,64%, в то время как лидер рейтинга — Gemini-3.1-Pro — справляется лишь на 73,17%. Открытые модели (open-source) демонстрируют еще более слабые результаты, «разваливаясь» при столкновении с контрфактуальными данными.

Субъект Точность (Accuracy) Комментарий
Человек 88,64% Эталонный уровень рассуждения
Gemini-3.1-Pro 73,17% Лучший результат среди ИИ-моделей
Open-source модели Значительно ниже Критический спад при конфликте модальностей

Диагноз: 95% внимания на текст

Анализ через attention probes выявил механику сбоя: 87–95% внимания модели концентрируется на текстовом вводе. Даже когда видео или аудио содержат критически важную информацию, противоречащую тексту, архитектура модели «залипает» на словах. Исследование также показало, что энтропия внимания в средних слоях сети является предиктором успеха: если модель не совершает преждевременного коллапса внимания, она имеет больше шансов на верный ответ.

Вывод для индустрии

Разница в точности на 56 пунктов между шаблонами одинаковой сложности доказывает, что проблема не в комбинации модальностей, а в их структурной роли. Вывод однозначен: мультимодальное восприятие не гарантирует надежного рассуждения. Следующему поколению архитектур необходимо внедрять механизмы устойчивого кросс-модального внимания, чтобы избежать преждевременного принятия решений на основе только одного типа данных.

Источник: arXiv cs.AI ↗