Главная/Блог/Гайд/Marker 2 против MinerU, Docling и…
Гайд9 мин чтения · 26 июля 2026 г.

Marker 2 против MinerU, Docling и LiteParse: Глубокий разбор бенчмарков

Разбираем релиз Datalab Marker 2: как новая архитектура с Surya OCR 2 обходит конкурентов по скорости и точности, и что это значит для вашего RAG-пайплайна.

Marker 2 против MinerU, Docling и LiteParse: Глубокий разбор бенчмарков

В мире обработки документов для искусственного интеллекта (AI) существует вечная дилемма: как извлечь структурированные данные из неструктурированных PDF-файлов, сохраняя при этом баланс между скоростью, точностью и стоимостью вычислений? Недавно команда Datalab представила Marker 2, полную переработку своего открытого конвейера конвертации документов. Это не просто очередное обновление, а архитектурный сдвиг, который заставляет пересмотреть подходы к сравнению таких решений, как MinerU, Docling и LiteParse. Marker 2 позиционируется как инструмент, способный конкурировать с проприетарными моделями по качеству, но при этом предлагать гибкость локального запуска.

В основе нового релиза лежит переосмысление того, как модели компьютерного зрения и оптического распознавания символов (OCR) взаимодействуют с текстовыми слоями PDF. Команда Datalab объединила три ключевых компонента, разработанных за последние месяцы: Surya OCR 2, легковесную модель компоновки на 20 миллионов параметров и переработанный модуль pdftext, который стал в три раза быстрее предыдущей версии. Результатом стал инструмент, который не только превосходит многих конкурентов по скорости обработки, но и предлагает уникальную гибкость в выборе режимов работы.

В этой статье мы подробно разберем результаты бенчмарков, архитектурные особенности Marker 2, сравним его с ключевыми игроками рынка и проанализируем лицензионные условия, которые могут стать решающим фактором для коммерческих проектов. Мы также рассмотрим, как эти изменения влияют на практическое применение в задачах извлечения знаний (RAG) и автоматизации документооборота.

01Архитектурный прорыв: Что нового в Marker 2?

Marker 2 — это не просто «версия 2.0» старого кода, а фундаментальная перестройка пайплайна. Главная инновация заключается в том, что теперь система предлагает три различных пути конвертации, каждый из которых оптимизирован под конкретные задачи и доступные вычислительные ресурсы. Это позволяет разработчикам выбирать между максимальным качеством, скоростью и экономичностью в зависимости от контекста использования.

Режим Balanced: Золотой стандарт качества

Режим balanced (сбалансированный) является флагманским решением для задач, где критически важна точность. В этом режиме используется модель Surya VLM (Vision Language Model) для анализа макета страницы. Если встроенный текстовый слой PDF оказывается некачественным (например, из-за сканирования или сложной верстки), система автоматически выполняет повторное OCR всей страницы. Этот подход обеспечивает наивысшее качество извлечения данных.

На бенчмарке olmOCR-bench от Allen AI режим Balanced набирает 76,0% в общем зачете и 83,5% на «рожденных цифровых» PDF-файлах (документах, изначально созданных в цифровом виде, а не отсканированных). При этом он демонстрирует впечатляющую скорость: 2,9 страницы в секунду на одном GPU NVIDIA B200. Это более чем в 5 раз превышает пропускную способность бэкенда MinerU, который показывает 0,54 страницы в секунду при результате 72,7%.

Режим Fast: Оптимизация для CPU и экономии

Для сценариев, где GPU недоступен или слишком дороги, был разработан режим fast. Он использует легковесный детектор компоновки на базе rf-detr/onnx и модуль pdftext, применяя VLM-модели минимально и точечно. Этот режим набирает 66,6% на olmOCR-bench, что немного уступает Balanced, но при этом значительно дешевле в исполнении. Он идеально подходит для сред с ограниченными ресурсами, где важна скорость, а не абсолютная точность.

Режим –disable_ocr: Чистая скорость на CPU

Третий режим, –disable_ocr, полностью исключает вызовы VLM и извлекает только текстовый слой PDF. Он работает исключительно на CPU и демонстрирует рекордную скорость — 23,7 страницы в секунду, но при этом набирает всего 43,6% точности. Этот режим полезен для быстрой предварительной обработки или работы с простыми текстовыми документами, где структура не играет ключевой роли.

Marker 2 против MinerU, Docling и LiteParse: Глубокий разбор бенчмарков
💡
Важно знать. Marker 2 теперь автоматически определяет устройство. По умолчанию он выбирает режим Balanced для GPU, Fast для CPU/MPS, но это можно переопределить через флаг --mode. Полная поддержка CPU — это вторая ключевая структурная особенность, позволяющая запускать систему без GPU и серверов инференса.

Третье архитектурное изменение отвечает за высокую пропускную способность. Вместо того чтобы каждый процесс требовал собственной VRAM, множество тонких CPU-воркеров разделяют один сервер инференса Surya. Родительский процесс распределяет конкурентность VLM между ними, что позволяет масштабировать пропускную способность в зависимости от мощности сервера, а не от количества видеокарт. Datalab сообщает, что в режиме Balanced достигается около 2,9 страниц в секунду по сравнению с 0,3 страницы в секунду в однопоточном режиме на том же оборудовании.

Архитектура обработки документов в Marker 2: взаимодействие CPU-воркеров и сервера инференса Surya.
Архитектура обработки документов в Marker 2: взаимодействие CPU-воркеров и сервера инференса Surya.

02Сравнение с конкурентами: MinerU, Docling и LiteParse

Чтобы понять место Marker 2 на рынке, необходимо сравнить его с основными альтернативами. Бенчмарк olmOCR-bench от Ai2 включает 1403 PDF-файла с примерно 8400 тестами на проверку рендеринга математики, структуры таблиц, порядка чтения, заголовков и подвалов, а также старых сканов. Все цифры ниже получены в собственных запусках Datalab и воспроизводимы через открытый хаб в репозитории Marker.

Marker 2 vs MinerU: Бита производительности

MinerU является ближайшим архитектурным аналогом Marker 2, так как оба решения читают текстовый слой PDF и выполняют выборочное OCR. В общем зачете Marker Balanced лидирует с результатом 76,0% против 72,7% у MinerU. На «рожденных цифровых» документах разница минимальна: 83,5% против 83,3%. Однако разрыв в скорости впечатляет: Marker Balanced обрабатывает 2,9 страницы в секунду, в то время как MinerU — всего 0,54. Это разница в 5,4 раза при более высоком качестве.

Режим Fast у Marker 2 достигает 7,4 страниц в секунду, что примерно в 13,7 раза быстрее MinerU, но при этом теряет 6,1 процентного пункта в точности. Стоит отметить, что MinerU также предлагает бэкенд на базе VLM, который показывает более высокие результаты, чем его пайплайн, но этот режим не был включен в данный сравнительный анализ. Командам, использующим MinerU, рекомендуется тестировать этот путь отдельно.

Marker 2 vs Docling: Качество против управления

Docling демонстрирует самый большой разрыв среди GPU-пайплайнов. Marker Balanced опережает Docling по общему баллу (76,0% против 50,3%) и по скорости (2,9 против 2,1 страницы в секунду). Docling использует текстовый слой для цифровых страниц и OCR для изображений, но его результаты значительно уступают Marker.

Однако у Docling есть свои сильные стороны: управление и широта форматов. Код распространяется под лицензией MIT, проект originated в IBM Research и поддерживается Foundation LF AI & Data. Он поддерживает не только документы, но и аудио, и электронную почту. Для команд, где важны корпоративные стандарты и открытость лицензии, Docling может быть предпочтительнее, несмотря на меньшую точность.

Marker 2 vs LiteParse: Скорость против структуры

LiteParse от LlamaIndex — это парсер на Rust, который не конкурирует в той же плоскости. На CPU он набирает 22,4% в общем зачете и 20,4% без OCR, тогда как Marker в режиме только CPU (–disable_ocr) показывает 43,6%. Однако LiteParse с отключенным OCR выдает невероятную скорость — 1721 страницу в секунду, что примерно в 73 раза быстрее режима CPU у Marker.

Компромисс здесь очевиден: LiteParse не имеет модели компоновки и «схлопывается» на нелинейных структурах. Marker же использует 20-миллионную модель компоновки на CPU, что позволяет ему более чем вдвое превзойти простой дамп текста по качеству, сохраняя при этом приемлемую скорость для многих задач.

Marker 2 против MinerU, Docling и LiteParse: Глубокий разбор бенчмарков

03Лицензирование: Ключевой фактор для бизнеса

Для коммерческих команд лицензионные условия могут стать решающим фактором при выборе инструмента. Здесь системы сильно расходятся:

  • Marker: Код распространяется под Apache 2.0. Однако веса моделей используют модифицированную лицензию AI Pubs OpenRAIL-M. Она бесплатна для исследований, личного использования и стартапов с финансированием/выручкой до 5 миллионов долларов. Для коммерческого использования весов свыше этого порога требуется платная лицензия.
  • MinerU: Использует собственную лицензию на базе Apache 2.0 с дополнительными условиями. Коммерческая лицензия требуется при превышении 100 миллионов активных пользователей в месяц или 20 миллионов долларов ежемесячной выручки. Онлайн-сервисы должны раскрывать факт использования MinerU.
  • Docling: Лицензия MIT, что делает его наиболее открытым решением. Лицензии моделей отслеживаются отдельно в их оригинальных пакетах.
  • LiteParse: Открытый исходный код от run-llama, с LlamaParse, позиционируемым как платный облачный путь для сложных документов.
⚠️
Важно для РФ. При выборе решения для локального запуска в России важно учитывать не только лицензию, но и доступность моделей. Marker 2, будучи открытым и поддерживающим локальный инференс, позволяет полностью изолировать процесс обработки данных, что критично для соблюдения законов о локализации данных. Docling также является отличным выбором благодаря лицензии MIT и отсутствию ограничений по выручке.

04Поведение по категориям: Где теряется точность?

Выбор режима влияет не только на общий балл, но и на профиль ошибок. Математика остается сложной задачей: в режиме Fast уравнения читаются из текстового слоя PDF, а не через VLM-OCR, поэтому для математических документов arXiv точность падает с 83,9% до 23,4%, а в режиме –disable_ocr она составляет 0,0% по дизайну. Вне двух математических категорий самым слабым местом во всех режимах являются старые сканы, где точность не превышает 43,2%.

Это подчеркивает важность понимания природы ваших документов. Если вы работаете с современными цифровыми документами, Marker 2 в режиме Balanced или Fast покажет отличные результаты. Если же у вас архив сканов или сложные математические формулы, возможно, стоит рассмотреть гибридные подходы или использование полных VLM-решений, таких как Chandra 2 или Gemini Flash 3.5, которые показывают более высокие результаты (85,8% и 76,4% соответственно), но требуют вызова API и не подходят для полностью локального запуска.

05Что это значит на практике

Результаты бенчмарков Marker 2 говорят сами за себя: это мощный инструмент, который закрывает разрыв между открытыми решениями и проприетарными моделями. Для команд, строящих RAG-системы, Marker 2 предлагает гибкость, позволяющую оптимизировать затраты на GPU, не жертвуя качеством извлечения данных. Режим Balanced обеспечивает точность, близкую к топовым облачным решениям, а режимы Fast и CPU-only делают возможным запуск на более дешевом оборудовании.

Однако выбор инструмента должен основываться не только на цифрах. Если вам нужна максимальная открытость и отсутствие ограничений по выручке, Docling остается сильным кандидатом. Если же критична скорость обработки огромных объемов простых документов, LiteParse может быть предпочтительнее. Marker 2 же занимает уникальную нишу, предлагая баланс между качеством, скоростью и возможностью локального развертывания, что делает его одним из самых перспективных решений в области обработки документов для AI.

Команда Datalab также предоставляет воспроизводимый хаб для тестирования, что позволяет каждой команде проверить эти результаты на своем собственном корпусе документов. Это важный шаг к объективной оценке, так как результаты на реальных данных могут отличаться от бенчмарков. Мы рекомендуем всем, кто работает с PDF-документами, протестировать Marker 2 в своих условиях, чтобы определить оптимальный режим работы для ваших задач.

Источник: MarkTechPost ↗