Инструменты25 июля 2026 г., 06:17 МСК🤖 Auto

Marker 2: 5x быстрее MinerU и 76% на olmOCR-bench

Datalab выпустила переписанный с нуля парсер документов Marker 2. Он превосходит MinerU по скорости в 5 раз, а Docling — по точности, предлагая гибкие режимы работы на CPU и GPU.

Баннер новости 4353

Архитектурный прорыв: три режима работы

Marker 2 — это полная переработка конвейера конвертации документов, объединяющая Surya OCR 2 (модель распознавания макета на 20 млн параметров), обновленный pdftext (в 3 раза быстрее предшественника) и новую логику оркестрации. Система поддерживает форматы PDF, изображения, PPTX, DOCX, XLSX, HTML и EPUB, преобразуя их в Markdown, JSON или HTML.

Ключевое отличие новой версии — три режима конвертации, адаптированных под разные задачи:

  • Balanced (Сбалансированный): Использует Surya VLM для анализа макета и повторного OCR при плохом качестве текста. Максимальное качество, оптимизировано для GPU.
  • Fast (Быстрый): Легкий детектор макета (rf-detr/onnx) с минимальным использованием VLM. Дешевле и быстрее, но чуть менее точен.
  • –disable_ocr: Чистое извлечение текстового слоя без вызовов VLM. Работает полностью на CPU.

Результаты бенчмарка olmOCR-bench

Тестирование проводилось на наборе данных olmOCR-bench от Allen AI, включающем 1 403 PDF-файла и около 8 400 тестов на корректность структуры, таблиц и формул. Все замеры производительности выполнены на одной GPU B200.

Модель / Режим Общий балл (%) Родные PDF (%) Скорость (стр/сек)
Marker 2 (Balanced) 76.0 83.5 2.9
MinerU (Pipeline) 72.7 83.3 0.54
Docling (Default) 50.3 64.0 2.1
Marker 2 (Fast) 66.6 7.4
Marker 2 (CPU, no OCR) 43.6 23.7

Marker 2 в режиме Balanced показывает скорость 2.9 страницы в секунду, что более чем в 5 раз превышает показатель MinerU (0.54 стр/сек) при более высокой точности. Режим Fast достигает 7.4 стр/сек, опережая MinerU в 13.7 раза, но снижает точность до 66.6%.

Почему это важно для разработчиков

Главное архитектурное изменение — разделение CPU-воркеров и сервера инференса Surya. Это позволяет масштабировать пропускную способность в зависимости от мощности сервера, а не ограничиваться VRAM одного процесса. Система автоматически выбирает режим: Balanced для GPU, Fast для CPU/MPS.

Для коммерческого использования важно учитывать лицензирование: код Marker 2 распространяется под Apache 2.0, но веса моделей используют лицензию AI Pubs OpenRAIL-M. Она бесплатна для исследований, личного использования и стартапов с финансированием/выручкой до $5 млн. Для крупного бизнеса требуется платная лицензия.

Технические детали и совместимость

Marker 2 требует Python 3.10+ и использует менеджер пакетов uv (хотя установка через pip остается прежней). Из системы удалены модули структурированного извлечения; для сложных задач Datalab рекомендует использовать хостинговый API или интеграцию с LLM. Система полностью совместима с CPU, что делает её доступной для развертывания без специализированного оборудования в режиме «быстрого извлечения».

Источник: MarkTechPost ↗