Исследования3 сентября 2026 г., 12:18 МСК🤖 Auto

DocHop: MLLM провалили тест на сложное чтение документов (макс. 62.8%)

Новый бенчмарк DocHop, принятый в ICML 2026, выявил критический разрыв между способностями мультимодальных моделей и людьми в анализе плотных документов с графиками.

Баннер новости 6670

Проблема изолированных доменов

Мультимодальные большие языковые модели (MLLM) демонстрируют отличные результаты на структурированных задачах, таких как оптическое распознавание символов (OCR) или ответы на вопросы по отдельным диаграммам. Однако существующие бенчмарки оценивают эти навыки изолированно. Они не проверяют ключевую способность: может ли модель использовать текстовый контекст документа для определения того, какие именно графики выбрать, как их интерпретировать и агрегировать данные.

Что такое DocHop

Авторы (Zhuoran Yu и соавторы) представили DocHop — первый бенчмарк для оценки интегрированного рассуждения «график-контекст» на изображениях, стилизованных под документы. В отличие от простых задач, здесь:

  • Текстовое повествование задает многошаговые композиционные ограничения.
  • Графики содержат соответствующие числовые значения.
  • Вопросы привязаны к семантической ссылке, определенной в тексте, что требует от модели сначала разрешить целевые сущности из контекста, а затем агрегировать доказательства из нескольких графиков.

Методология и масштаб

Для создания набора данных использовался стохастический конвейер генерации «логика-первой» (logic-first) с контролируемой глубиной рассуждений и визуальной плотностью. Набор данных включает 2 074 примера, охватывающих шесть категорий задач, что позволяет систематически оценивать сложность.

Результаты: разрыв с человеком

Эксперименты с широким спектром проприетарных и open-source MLLM показали существенный разрыв в производительности. Аннотаторы-люди достигают точности более 90%, в то время как лучшая модель показала результат всего 62.83%. Улучшение за счет методов усиления рассуждений (reasoning-enhanced) наблюдается, но производительность резко падает по мере увеличения сложности логики.

Сравнение производительности

Показатель Значение Комментарий
Точность людей (annotators) > 90% Базовый уровень компетенции
Лучшая MLLM (DocHop) 62.83% Максимальный результат среди протестированных моделей
Размер датасета 2 074 примера 6 категорий задач, контролируемая сложность
Веню публикации ICML 2026 Принято к публикации в сентябре 2026 г.

DocHop предоставляет контролируемый полигон для тестирования многошагового документного рассуждения, подчеркивая необходимость развития моделей в области интеграции текстового и визуального контекста.

Источник: arXiv cs.AI ↗