Архитектурный прорыв: три режима работы
Marker 2 — это полная переработка конвейера конвертации документов, объединяющая Surya OCR 2 (модель распознавания макета на 20 млн параметров), обновленный pdftext (в 3 раза быстрее предшественника) и новую логику оркестрации. Система поддерживает форматы PDF, изображения, PPTX, DOCX, XLSX, HTML и EPUB, преобразуя их в Markdown, JSON или HTML.
Ключевое отличие новой версии — три режима конвертации, адаптированных под разные задачи:
- Balanced (Сбалансированный): Использует Surya VLM для анализа макета и повторного OCR при плохом качестве текста. Максимальное качество, оптимизировано для GPU.
- Fast (Быстрый): Легкий детектор макета (rf-detr/onnx) с минимальным использованием VLM. Дешевле и быстрее, но чуть менее точен.
- –disable_ocr: Чистое извлечение текстового слоя без вызовов VLM. Работает полностью на CPU.
Результаты бенчмарка olmOCR-bench
Тестирование проводилось на наборе данных olmOCR-bench от Allen AI, включающем 1 403 PDF-файла и около 8 400 тестов на корректность структуры, таблиц и формул. Все замеры производительности выполнены на одной GPU B200.
| Модель / Режим | Общий балл (%) | Родные PDF (%) | Скорость (стр/сек) |
|---|---|---|---|
| Marker 2 (Balanced) | 76.0 | 83.5 | 2.9 |
| MinerU (Pipeline) | 72.7 | 83.3 | 0.54 |
| Docling (Default) | 50.3 | 64.0 | 2.1 |
| Marker 2 (Fast) | 66.6 | — | 7.4 |
| Marker 2 (CPU, no OCR) | 43.6 | — | 23.7 |
Marker 2 в режиме Balanced показывает скорость 2.9 страницы в секунду, что более чем в 5 раз превышает показатель MinerU (0.54 стр/сек) при более высокой точности. Режим Fast достигает 7.4 стр/сек, опережая MinerU в 13.7 раза, но снижает точность до 66.6%.
Почему это важно для разработчиков
Главное архитектурное изменение — разделение CPU-воркеров и сервера инференса Surya. Это позволяет масштабировать пропускную способность в зависимости от мощности сервера, а не ограничиваться VRAM одного процесса. Система автоматически выбирает режим: Balanced для GPU, Fast для CPU/MPS.
Для коммерческого использования важно учитывать лицензирование: код Marker 2 распространяется под Apache 2.0, но веса моделей используют лицензию AI Pubs OpenRAIL-M. Она бесплатна для исследований, личного использования и стартапов с финансированием/выручкой до $5 млн. Для крупного бизнеса требуется платная лицензия.
Технические детали и совместимость
Marker 2 требует Python 3.10+ и использует менеджер пакетов uv (хотя установка через pip остается прежней). Из системы удалены модули структурированного извлечения; для сложных задач Datalab рекомендует использовать хостинговый API или интеграцию с LLM. Система полностью совместима с CPU, что делает её доступной для развертывания без специализированного оборудования в режиме «быстрого извлечения».
Источник: MarkTechPost ↗
