Исследования24 сентября 2026 г., 09:19 МСК🤖 Auto

Эффект последнего слова: порядок данных ломает логику мультимодальных ИИ

Исследование arXiv:2609.26986 доказывает, что мультимодальные модели не коммутативны: один и тот же набор фактов дает разные ответы в зависимости от того, где он расположен — в начале или в конце промпта.

Баннер новости 8165

Проблема «последнего слова» в мультимодальных моделях

Новое исследование, представленное на arXiv, вскрывает критический недостаток современных мультимодальных больших языковых моделей (MLLM). Авторы доказали, что при конфликте между текстовой информацией и визуальными или аудиоданными модель склонна доверять тому источнику, который подан последним. Это явление авторы называют некоммутативностью доказательств (evidence noncommutativity): перестановка местами контента меняет итоговый вывод, даже если сам набор фактов остается неизменным.

Методология: контроль переменных

Ранее исследования текстового предубеждения (text bias) часто использовали фиксированный порядок данных или перемещали инструкции вместе с доказательствами, что не позволяло изолировать влияние именно позиции. В этой работе команда во главе с Чжуоюнем Ли (Zhuoyun Li) применила метод парного сравнения:

  • Инструкции и содержание доказательств оставались неизменными.
  • Менялась только последовательность подачи: сначала текст, затем изображение/аудио, и наоборот.

Эксперименты проводились на моделях, обрабатывающих зрительные и речевые данные, что позволило выявить универсальный паттерн поведения ИИ.

Ключевые результаты

Результаты подтвердили гипотезу о «эффекте последнего слова». В ситуациях, когда визуальные/аудио данные противоречат тексту, модель с большей вероятностью выберет версию, соответствующую контенту, который был предоставлен в конце промпта. Это создает риск манипуляций и ошибок в критически важных задачах, где важна объективность.

Порядок подачи данных Направление смещения ответа Влияние на надежность
Текст → Визуал/Аудио Смещение в сторону визуального/аудио контента Высокая зависимость от последних введенных данных
Визуал/Аудио → Текст Смещение в сторону текстового описания Текст «перекрывает» ранее полученные сенсорные данные

Почему это важно для индустрии

Открытие имеет далеко идущие последствия для разработки и внедрения мультимодальных систем. Оно объясняет, почему некоторые предыдущие исследования могли приходить к вводящим в заблуждение выводам о предвзятости моделей. Для разработчиков это означает необходимость:

  1. Стандартизировать порядок ввода данных в промптах для воспроизводимости результатов.
  2. Разрабатывать механизмы, устойчивые к позиционному bias, особенно в задачах фактчекинга и анализа доказательств.
  3. Учитывать порядок аргументов при создании интерфейсов для взаимодействия человека и ИИ.

Исследование подчеркивает, что «контекст» в мультимодальных моделях — это не только содержание, но и строгая последовательность обработки информации.

Источник: arXiv cs.AI ↗