В 2026 году большая часть корпоративных данных по-прежнему «заперта» внутри PDF-файлов, отсканированных изображений и презентаций. Крупные языковые модели (LLM) и AI-агенты не могут эффективно работать с этой информацией, пока она не станет структурированным JSON. Именно здесь на сцену выходит open-source извлечение документов — стандартный способ выполнить эту конвертацию на собственном оборудовании, без отправки данных в облако провайдеров.
За фразой «PDF в JSON» скрываются две совершенно разные задачи. Первая — это извлечение по схеме (schema-driven extraction): вы определяете нужные поля, а модель заполняет их значениями. Вторая — это парсинг документа (document parsing): модель реконструирует страницу, восстанавливая структуру, порядок чтения, таблицы и формулы, чтобы экспортировать результат в JSON или Markdown. Большинство команд нуждается в одном из этих подходов, а иногда и в обоих. Выбор неверной категории стоит реального времени и ресурсов.
Здесь критически важны open weights (открытые веса моделей). Проприетарные API могут стоить тысячи долларов за миллион страниц и требуют отправки документов на внешние серверы, что недопустимо для конфиденциальных данных. Локальные модели снимают оба ограничения. Ниже представлен подробный разбор моделей и инструментов, которые стоит оценить, сгруппированных по их реальному назначению.
01Две категории, одна задача: в чем разница?
Прежде чем выбирать инструмент, необходимо четко разделить задачи. Schema-driven extraction (извлечение по схеме) берет документ и JSON-схему, затем возвращает значения для ваших полей. Этот подход идеален для счетов-фактур, форм, контрактов и чеков, где вы заранее знаете структуру данных. Если вам нужно извлечь «Сумму», «Дату» и «Наименование поставщика», это ваш путь.
Document parsing (парсинг документа) реконструирует сам документ. Он обнаруживает макет, порядок чтения, таблицы, формулы и код, затем экспортирует результат в JSON или Markdown. Этот подход используется для подготовки чистых корпусов данных для систем Retrieval-Augmented Generation (RAG) и AI-агентов. Если вы строите базу знаний, где важно сохранить контекст и структуру, вам нужен парсер.
02Категория 1: Извлечение по схеме (Schema-driven)
В этой категории лидируют модели, которые гарантируют валидность выходных данных в соответствии с заданной схемой. Это снижает необходимость в постобработке и валидации JSON.
Datalab lift: 9B модель с точностью 90.2%
lift — это 9-миллиардная модель компьютерного зрения от Datalab, команды, стоящей за проектами Marker и Surya. Вы передаете JSON-схему, и lift возвращает JSON, который ей соответствует. Использование schema-constrained decoding гарантирует, что вывод всегда будет валидным JSON. Модель построена на базе Qwen 3.5 и может запускаться локально через Hugging Face или удаленно через сервер vLLM.
Ключевая особенность lift — способность обрабатывать многостраничные документы за один проход, включая значения, которые пересекают границы страниц. Модель поставляется с CLI, Python API и интерфейсом Streamlit «Schema Studio» для создания и тестирования схем.
pip install lift
# Запуск сервера vLLM, затем извлечение по вашей схеме
lift_vllm
lift_extract input.pdf output --schema schema.jsonfrom lift import extract
result = extract("document.pdf", "schema.json")
if result.extraction is not None:
data = result.extraction # словарь, соответствующий вашей схемеНа бенчмарке Datalab, состоящем из 225 документов, lift достигает точности 90.2% на уровне полей при медианной задержке 9.5 секунд. Он опережает NuExtract3 (81.5%) и Qwen3.5-9B (76.3%) по точности извлечения полей. Однако стоит отметить, что lift уступает Gemini Flash 3.5 (91.3%) и хостинговому API Datalab (95.9%). Важно понимать, что полная точность документа (когда все поля верны одновременно) остается низкой для всех локальных моделей: у lift она составляет 20.9%. Получить абсолютно все поля правильно в одном документе с первого раза пока сложно.
Код распространяется под лицензией Apache-2.0. Веса модели используют модифицированную лицензию OpenRAIL-M, которая бесплатна для исследований, личного использования и стартапов с финансированием или выручкой до 5 миллионов долларов. Коммерческое самостраховывание требует лицензии, и веса нельзя использовать для конкуренции с API Datalab.

NuMind NuExtract 3: Универсальная 4B модель
NuExtract 3 — это 4-миллиардная модель компьютерного зрения и языка от NuMind. Она объединяет две задачи в одной модели: структурированное извлечение (документ в JSON) и извлечение контента (OCR в Markdown). Вы предоставляете входные данные и JSON-шаблон, описывающий необходимые поля. Модель обучена с использованием усиленного обучения (reinforcement learning) для добавления рассуждений, специфичных для извлечения, которые можно включать или выключать для каждого запроса.
NuExtract 3 является мультимодальной, поддерживает несколько языков и построена на базе Qwen. Она обслуживается через vLLM с API, совместимым с OpenAI, и доступна через Python SDK. NuMind позиционирует ее как эталонную open-модель для обоих типов извлечения при ее размере. Перед коммерческим использованием обязательно проверьте точные условия лицензии в карточке модели.
03Категория 2: Парсинг документов в JSON и Markdown
Эта категория инструментов фокусируется на реконструкции макета документа. Они идеальны для подготовки данных для RAG, где важно сохранить контекст, таблицы и формулы.
IBM Docling: Индустриальный стандарт
Docling начал свою жизнь в IBM Research, а теперь поддерживается LF AI & Data Foundation. Он парсит PDF, DOCX, PPTX, XLSX, HTML, изображения и многое другое. Форматы вывода включают Markdown, HTML, lossless JSON и DocTags. Его ядро — представление DoclingDocument, которое сохраняет макет, порядок чтения, таблицы и формулы (в виде LaTeX).
Docling работает локально, что делает его идеальным для изолированных сред (air-gapped). Он интегрируется с LangChain, LlamaIndex, Crew AI и Haystack, а также поставляется с MCP-сервером и режимом Docling Serve. Проект распространяется под разрешительной лицензией MIT. IBM также предлагает управляемую версию через watsonx.
IBM Granite-Docling-258M: Компактный парсер
Granite-Docling-258M — это компактная 258-миллионная модель компьютерного зрения и языка от IBM. Она выполняет однократное преобразование документов внутри конвейеров Docling. Несмотря на малый размер, она справляется с OCR, макетом, таблицами, кодом и уравнениями, выдавая DocTags. На GPU A100 она в среднем обрабатывает страницу за 0.35 секунды.
Модель построена на архитектуре Idefics3 с энкодером SigLIP2 и языковым остовом Granite 165M. Она выпущена под лицензией Apache 2.0. IBM заявляет, что она создана специально для преобразования документов, а не для общего понимания изображений.

OpenDataLab MinerU: Высокое разрешение и сложные макеты
MinerU, разработанный OpenDataLab и Шанхайской лабораторией искусственного интеллекта, преобразует входные данные PDF, изображений, DOCX, PPTX и XLSX в Markdown и JSON. Он сочетает конвейер обработки с моделью компьютерного зрения и языка. Текущая модель, MinerU2.5-Pro, нацелена на высококачественный парсинг сложных макетов, включая таблицы и диаграммы, пересекающие страницы.
MinerU недавно изменил лицензию. Он перешел с AGPL-3.0 на «MinerU Open Source License» — пользовательскую лицензию на базе Apache 2.0 с дополнительными условиями. Это изменение снижает барьеры для коммерческого развертывания.
Datalab Marker: Быстрый и надежный парсер
Marker — это конвейер Datalab для преобразования документов в Markdown, JSON, чанки и HTML. Он поддерживает PDF, изображения, PPTX, DOCX, XLSX, HTML и EPUB. Он форматирует таблицы, формы, уравнения, встроенную математику, ссылки и код. Опциональный флаг --use_llm добавляет языковую модель для улучшения качества таблиц и форм.
На стороннем наборе данных olmOCR-Bench Marker набирает около 76.1. Его код распространяется под GPL-3.0, а веса модели используют модифицированную лицензию AI Pubs OpenRAIL-M. Эта лицензия на веса бесплатна для исследований, личного использования и стартапов с финансированием или выручкой до 2 миллионов долларов. Управляемая платформа Datalab теперь запускает новую модель OCR Chandra, которая имеет лицензию Apache-2.0 и выводит HTML, Markdown и JSON.

Ai2 olmOCR 2: Специализированный OCR
olmOCR 2 — это 7-миллиардная OCR-специализированная модель компьютерного зрения и языка от Allen Institute for AI (Ai2). Она преобразует PDF в чистый текст и Markdown, сохраняя порядок чтения. Она обрабатывает таблицы, уравнения и рукописный текст в сложных многоколоночных макетах. Модель обучена с использованием усиленного обучения из проверяемых вознаграждений (RLVR), используя синтетические модульные тесты в качестве сигнала вознаграждения.
olmOCR 2 набирает 82.4 на собственном бенчмарке olmOCR-Bench, что является одним из самых высоких опубликованных результатов в этом наборе. Ai2 оценивает стоимость примерно в 178 долларов за миллион страниц на ваших собственных GPU. Инструментарий и веса allenai/olmOCR-2-7B-1025 распространяются под Apache-2.0. Текущая модель ориентирована на английский язык.
DeepSeek DeepSeek-OCR: Оптимизация токенов
DeepSeek-OCR — это открытая OCR-модель от DeepSeek, выпущенная в октябре 2025 года. Она представляет «оптическое сжатие контекстов» (contexts optical compression), которое представляет текстовые страницы в виде компактных визуальных токенов, а затем декодирует их обратно в текст. Это позволяет обрабатывать длинные документы с гораздо меньшим количеством токенов, чем типичные модели компьютерного зрения и языка.
Она использует DeepEncoder и декодер Mixture-of-Experts (MoE) на 3B, который активирует около 570 миллионов параметров на токен. В зависимости от запроса она выводит обычный текст, Markdown, HTML-таблицы или структурированный JSON, и поддерживает более 100 языков. Код выпущен под лицензией MIT. В январе 2026 года последовала версия DeepSeek-OCR2.

04Общеприменимое решение: Qwen3-VL
Qwen3-VL от Alibaba не является специализированной моделью для документов. Это общая мультимодальная серия, которую многие модели извлечения используют в качестве основы. Вы можете запросить у нее вернуть Markdown, JSON или код со страницы. Большинство размеров выпущены под Apache 2.0. Это гибкий запасной вариант, когда специализированная модель не подходит, хотя она требует больше настройки промптов и предлагает меньше гарантий вывода.
05Сравнение опций
Ниже приведена сводная таблица для быстрого сравнения ключевых характеристик моделей, описанных выше. Обратите внимание, что бенчмарки не являются напрямую сопоставимыми, так как они используют разные наборы данных и метрики.

| Модель | Организация | Размер | Назначение | Основной вывод | Лицензия |
|---|---|---|---|---|---|
| lift | Datalab | 9B | Извлечение по схеме | JSON по вашей схеме | Apache-2.0 код / OpenRAIL-M веса |
| NuExtract 3 | NuMind | 4B | Схема + OCR | JSON + Markdown | Открытые веса (см. карточку) |
| Docling | IBM / LF AI | Пайплайн | Парсинг макета | Markdown, JSON, DocTags | MIT |
| Granite-Docling | IBM | 258M | Однократное преобразование | DocTags, Markdown | Apache 2.0 |
| MinerU | OpenDataLab | ~1.2B VLM | Парсинг макета | Markdown, JSON | MinerU Open Source License |
| Marker | Datalab | Пайплайн | Парсинг макета | Markdown, JSON, HTML | GPL-3.0 код / OpenRAIL-M веса |
| olmOCR 2 | Ai2 | 7B | OCR в текст | Plain text, Markdown | Apache 2.0 |
| DeepSeek-OCR | DeepSeek | 3B MoE (~570M active) | OCR со сжатием токенов | Текст, Markdown, JSON | MIT (код) |
| Qwen3-VL | Alibaba | 2B–235B | Общий VLM | Markdown, JSON, код | Apache 2.0 (большинство размеров) |
06Ключевые выводы
- Извлечение по схеме (поля в значения) и парсинг документа (макет в JSON) — это разные задачи.
- lift и NuExtract 3 нацелены на извлечение по схеме JSON; остальные нацелены на парсинг документа.
- Docling, MinerU, Marker, olmOCR 2 и DeepSeek-OCR парсят документы в структурированный Markdown или JSON.
- Лицензии сильно различаются: MinerU отказался от AGPL-3.0 в 2026 году, а lift и Marker разделили лицензии на код и веса модели.
- Опубликованные бенчмарки основаны на разных наборах данных, поэтому рассматривайте кросс-модельные оценки как указательные, а не сравнительные.
07Что это значит на практике
Для российских компаний и разработчиков, работающих в условиях ограничений на доступ к зарубежным облачным API, локальный запуск open-source моделей становится не просто опцией, а необходимостью. Выбор между lift и Docling зависит от того, что именно вы извлекаете. Если вам нужно автоматически заполнять реестры счетов-фактур, lift с его гарантией валидности JSON и высокой точностью полей будет лучшим выбором. Если же вы строите систему поиска по внутренним нормативным документам, Docling или MinerU обеспечат лучшее сохранение структуры и контекста.
Важно также учитывать лицензионные ограничения. Модели с лицензиями типа OpenRAIL-M или Apache-2.0 позволяют коммерческое использование, но могут иметь ограничения на конкуренцию с провайдерами или требования к открытию производных работ. Перед внедрением в production-среду обязательно проведите аудит лицензий и протестируйте модели на репрезентативной выборке ваших документов, так как публичные бенчмарки не всегда отражают качество на специфичных для бизнеса данных.
Экосистема open-source извлечения документов в 2026 году зрелая и разнообразная. Наличие мощных локальных моделей, таких как 9B lift или 7B olmOCR 2, позволяет строить надежные, безопасные и экономичные пайплайны обработки данных, не зависящие от внешних провайдеров. Это открывает новые возможности для автоматизации документооборота и создания AI-ассистентов, работающих с чувствительной информацией.
Источник: MarkTechPost ↗
