Исследования7 августа 2026 г., 04:18 МСК🤖 Auto

Промпты в пикселях: почему MLLM теряют 17.8% точности на визуальных задачах

Исследование arXiv:2608.04726 выявило критический разрыв в семантическом восприятии у мультимодальных моделей: перенос вопроса в изображение снижает точность на 17.8 пункта, даже при идеальном распознавании текста.

Баннер новости 5265

Суть проблемы: семантический разрыв каналов

Мультимодальные большие языковые модели (MLLM) всё чаще анализируют скриншоты и документы, где инструкция может быть представлена не как текст, а как часть изображения. Авторы исследования вводят концепцию Visualized Task Semantics (VTS) — контролируемый эксперимент, где вопрос переносится в пиксели изображения, в то время как источник задачи и правильный ответ остаются неизменными. Это позволяет изолировать влияние формата подачи инструкции.

Результаты оказались однозначными: во всех 24 парах «модель-задача» точность снизилась. Средний падение составило 17.8 процентных пункта. Это доказывает, что способность модели распознавать текст (OCR) и способность использовать этот текст как инструкцию для рассуждения — это две разные, не всегда совпадающие способности.

Экспериментальные данные и метрики

Исследование охватило шесть популярных MLLM и четыре бенчмарка. Ключевым наблюдением стало то, что модели часто корректно транскрибируют визуальный вопрос, но затем игнорируют его или используют некорректно при построении ответа. Для решения этой проблемы авторы предложили метод prompt-region grounding, который выравнивает регион вопроса с его текстовой семантикой и восстанавливает чистое представление из маскированного вида.

Метрика / Параметр До внедрения метода После внедрения Prompt-Region Grounding Изменение
Среднее падение точности (VTS) -17.8 п.п. (базовый уровень)
Точность на 4 бенчмарках (VTS) 58.0% 66.3% +8.3 п.п.
Точность на оригинальном интерфейсе База Сохранена Без деградации
Требования к инференсу Не требуются OCR или метаданные регионов Оптимизация

Почему это важно для индустрии

Предложенный метод prompt-region grounding позволяет повысить точность работы с визуальными инструкциями на 8.3 процентных пункта (с 58.0% до 66.3%) при сопоставимых затратах на обучение. Важнейшее преимущество подхода — отсутствие необходимости в использовании OCR-модулей или метаданных о регионах во время инференса, что упрощает архитектуру и снижает вычислительные накладные расходы.

Исследование подчеркивает необходимость разделения задач распознавания текста и семантического понимания инструкций в мультимодальных системах. Для разработчиков AI-ассистентов, работающих с документооборотом и интерфейсами, это означает, что просто «увидеть» текст недостаточно — модель должна уметь «заземлить» (ground) этот текст как команду к действию.

Источник: arXiv cs.AI ↗