Проблема «последнего слова» в мультимодальных моделях
Новое исследование, представленное на arXiv, вскрывает критический недостаток современных мультимодальных больших языковых моделей (MLLM). Авторы доказали, что при конфликте между текстовой информацией и визуальными или аудиоданными модель склонна доверять тому источнику, который подан последним. Это явление авторы называют некоммутативностью доказательств (evidence noncommutativity): перестановка местами контента меняет итоговый вывод, даже если сам набор фактов остается неизменным.
Методология: контроль переменных
Ранее исследования текстового предубеждения (text bias) часто использовали фиксированный порядок данных или перемещали инструкции вместе с доказательствами, что не позволяло изолировать влияние именно позиции. В этой работе команда во главе с Чжуоюнем Ли (Zhuoyun Li) применила метод парного сравнения:
- Инструкции и содержание доказательств оставались неизменными.
- Менялась только последовательность подачи: сначала текст, затем изображение/аудио, и наоборот.
Эксперименты проводились на моделях, обрабатывающих зрительные и речевые данные, что позволило выявить универсальный паттерн поведения ИИ.
Ключевые результаты
Результаты подтвердили гипотезу о «эффекте последнего слова». В ситуациях, когда визуальные/аудио данные противоречат тексту, модель с большей вероятностью выберет версию, соответствующую контенту, который был предоставлен в конце промпта. Это создает риск манипуляций и ошибок в критически важных задачах, где важна объективность.
| Порядок подачи данных | Направление смещения ответа | Влияние на надежность |
|---|---|---|
| Текст → Визуал/Аудио | Смещение в сторону визуального/аудио контента | Высокая зависимость от последних введенных данных |
| Визуал/Аудио → Текст | Смещение в сторону текстового описания | Текст «перекрывает» ранее полученные сенсорные данные |
Почему это важно для индустрии
Открытие имеет далеко идущие последствия для разработки и внедрения мультимодальных систем. Оно объясняет, почему некоторые предыдущие исследования могли приходить к вводящим в заблуждение выводам о предвзятости моделей. Для разработчиков это означает необходимость:
- Стандартизировать порядок ввода данных в промптах для воспроизводимости результатов.
- Разрабатывать механизмы, устойчивые к позиционному bias, особенно в задачах фактчекинга и анализа доказательств.
- Учитывать порядок аргументов при создании интерфейсов для взаимодействия человека и ИИ.
Исследование подчеркивает, что «контекст» в мультимодальных моделях — это не только содержание, но и строгая последовательность обработки информации.
Источник: arXiv cs.AI ↗
