Главная/Блог/Гайд/PDF в JSON: Гид по open-source моделям…
Гайд11 мин чтения · 5 июля 2026 г.

PDF в JSON: Гид по open-source моделям извлечения данных в 2026 году

Как превратить неструктурированные PDF-документы в чистый JSON с помощью локальных open-source моделей. Обзор lift, NuExtract, Docling и других инструментов для RAG и автоматизации.

PDF в JSON: Гид по open-source моделям извлечения данных в 2026 году

В 2026 году большая часть корпоративных данных по-прежнему «заперта» внутри PDF-файлов, отсканированных изображений и презентаций. Крупные языковые модели (LLM) и AI-агенты не могут эффективно работать с этой информацией, пока она не станет структурированным JSON. Именно здесь на сцену выходит open-source извлечение документов — стандартный способ выполнить эту конвертацию на собственном оборудовании, без отправки данных в облако провайдеров.

За фразой «PDF в JSON» скрываются две совершенно разные задачи. Первая — это извлечение по схеме (schema-driven extraction): вы определяете нужные поля, а модель заполняет их значениями. Вторая — это парсинг документа (document parsing): модель реконструирует страницу, восстанавливая структуру, порядок чтения, таблицы и формулы, чтобы экспортировать результат в JSON или Markdown. Большинство команд нуждается в одном из этих подходов, а иногда и в обоих. Выбор неверной категории стоит реального времени и ресурсов.

Здесь критически важны open weights (открытые веса моделей). Проприетарные API могут стоить тысячи долларов за миллион страниц и требуют отправки документов на внешние серверы, что недопустимо для конфиденциальных данных. Локальные модели снимают оба ограничения. Ниже представлен подробный разбор моделей и инструментов, которые стоит оценить, сгруппированных по их реальному назначению.

01Две категории, одна задача: в чем разница?

Прежде чем выбирать инструмент, необходимо четко разделить задачи. Schema-driven extraction (извлечение по схеме) берет документ и JSON-схему, затем возвращает значения для ваших полей. Этот подход идеален для счетов-фактур, форм, контрактов и чеков, где вы заранее знаете структуру данных. Если вам нужно извлечь «Сумму», «Дату» и «Наименование поставщика», это ваш путь.

Document parsing (парсинг документа) реконструирует сам документ. Он обнаруживает макет, порядок чтения, таблицы, формулы и код, затем экспортирует результат в JSON или Markdown. Этот подход используется для подготовки чистых корпусов данных для систем Retrieval-Augmented Generation (RAG) и AI-агентов. Если вы строите базу знаний, где важно сохранить контекст и структуру, вам нужен парсер.

💡
Совет по выбору. Если ваша цель — автоматизация бизнес-процессов (например, обработка заявок), выбирайте schema-driven. Если вы строете RAG-систему для чат-бота по внутренней базе документов, выбирайте document parsing.

02Категория 1: Извлечение по схеме (Schema-driven)

В этой категории лидируют модели, которые гарантируют валидность выходных данных в соответствии с заданной схемой. Это снижает необходимость в постобработке и валидации JSON.

Datalab lift: 9B модель с точностью 90.2%

lift — это 9-миллиардная модель компьютерного зрения от Datalab, команды, стоящей за проектами Marker и Surya. Вы передаете JSON-схему, и lift возвращает JSON, который ей соответствует. Использование schema-constrained decoding гарантирует, что вывод всегда будет валидным JSON. Модель построена на базе Qwen 3.5 и может запускаться локально через Hugging Face или удаленно через сервер vLLM.

Ключевая особенность lift — способность обрабатывать многостраничные документы за один проход, включая значения, которые пересекают границы страниц. Модель поставляется с CLI, Python API и интерфейсом Streamlit «Schema Studio» для создания и тестирования схем.

terminalbash
pip install lift
# Запуск сервера vLLM, затем извлечение по вашей схеме
lift_vllm
lift_extract input.pdf output --schema schema.json
terminalpython
from lift import extract
result = extract("document.pdf", "schema.json")
if result.extraction is not None:
    data = result.extraction  # словарь, соответствующий вашей схеме

На бенчмарке Datalab, состоящем из 225 документов, lift достигает точности 90.2% на уровне полей при медианной задержке 9.5 секунд. Он опережает NuExtract3 (81.5%) и Qwen3.5-9B (76.3%) по точности извлечения полей. Однако стоит отметить, что lift уступает Gemini Flash 3.5 (91.3%) и хостинговому API Datalab (95.9%). Важно понимать, что полная точность документа (когда все поля верны одновременно) остается низкой для всех локальных моделей: у lift она составляет 20.9%. Получить абсолютно все поля правильно в одном документе с первого раза пока сложно.

Код распространяется под лицензией Apache-2.0. Веса модели используют модифицированную лицензию OpenRAIL-M, которая бесплатна для исследований, личного использования и стартапов с финансированием или выручкой до 5 миллионов долларов. Коммерческое самостраховывание требует лицензии, и веса нельзя использовать для конкуренции с API Datalab.

Сравнительная таблица моделей извлечения документов
Сравнительная таблица моделей извлечения документов

NuMind NuExtract 3: Универсальная 4B модель

NuExtract 3 — это 4-миллиардная модель компьютерного зрения и языка от NuMind. Она объединяет две задачи в одной модели: структурированное извлечение (документ в JSON) и извлечение контента (OCR в Markdown). Вы предоставляете входные данные и JSON-шаблон, описывающий необходимые поля. Модель обучена с использованием усиленного обучения (reinforcement learning) для добавления рассуждений, специфичных для извлечения, которые можно включать или выключать для каждого запроса.

NuExtract 3 является мультимодальной, поддерживает несколько языков и построена на базе Qwen. Она обслуживается через vLLM с API, совместимым с OpenAI, и доступна через Python SDK. NuMind позиционирует ее как эталонную open-модель для обоих типов извлечения при ее размере. Перед коммерческим использованием обязательно проверьте точные условия лицензии в карточке модели.

03Категория 2: Парсинг документов в JSON и Markdown

Эта категория инструментов фокусируется на реконструкции макета документа. Они идеальны для подготовки данных для RAG, где важно сохранить контекст, таблицы и формулы.

IBM Docling: Индустриальный стандарт

Docling начал свою жизнь в IBM Research, а теперь поддерживается LF AI & Data Foundation. Он парсит PDF, DOCX, PPTX, XLSX, HTML, изображения и многое другое. Форматы вывода включают Markdown, HTML, lossless JSON и DocTags. Его ядро — представление DoclingDocument, которое сохраняет макет, порядок чтения, таблицы и формулы (в виде LaTeX).

Docling работает локально, что делает его идеальным для изолированных сред (air-gapped). Он интегрируется с LangChain, LlamaIndex, Crew AI и Haystack, а также поставляется с MCP-сервером и режимом Docling Serve. Проект распространяется под разрешительной лицензией MIT. IBM также предлагает управляемую версию через watsonx.

IBM Granite-Docling-258M: Компактный парсер

Granite-Docling-258M — это компактная 258-миллионная модель компьютерного зрения и языка от IBM. Она выполняет однократное преобразование документов внутри конвейеров Docling. Несмотря на малый размер, она справляется с OCR, макетом, таблицами, кодом и уравнениями, выдавая DocTags. На GPU A100 она в среднем обрабатывает страницу за 0.35 секунды.

Модель построена на архитектуре Idefics3 с энкодером SigLIP2 и языковым остовом Granite 165M. Она выпущена под лицензией Apache 2.0. IBM заявляет, что она создана специально для преобразования документов, а не для общего понимания изображений.

Michal Sutter, автор статьи, специалист по науке о данных
Michal Sutter, автор статьи, специалист по науке о данных

OpenDataLab MinerU: Высокое разрешение и сложные макеты

MinerU, разработанный OpenDataLab и Шанхайской лабораторией искусственного интеллекта, преобразует входные данные PDF, изображений, DOCX, PPTX и XLSX в Markdown и JSON. Он сочетает конвейер обработки с моделью компьютерного зрения и языка. Текущая модель, MinerU2.5-Pro, нацелена на высококачественный парсинг сложных макетов, включая таблицы и диаграммы, пересекающие страницы.

MinerU недавно изменил лицензию. Он перешел с AGPL-3.0 на «MinerU Open Source License» — пользовательскую лицензию на базе Apache 2.0 с дополнительными условиями. Это изменение снижает барьеры для коммерческого развертывания.

Datalab Marker: Быстрый и надежный парсер

Marker — это конвейер Datalab для преобразования документов в Markdown, JSON, чанки и HTML. Он поддерживает PDF, изображения, PPTX, DOCX, XLSX, HTML и EPUB. Он форматирует таблицы, формы, уравнения, встроенную математику, ссылки и код. Опциональный флаг --use_llm добавляет языковую модель для улучшения качества таблиц и форм.

На стороннем наборе данных olmOCR-Bench Marker набирает около 76.1. Его код распространяется под GPL-3.0, а веса модели используют модифицированную лицензию AI Pubs OpenRAIL-M. Эта лицензия на веса бесплатна для исследований, личного использования и стартапов с финансированием или выручкой до 2 миллионов долларов. Управляемая платформа Datalab теперь запускает новую модель OCR Chandra, которая имеет лицензию Apache-2.0 и выводит HTML, Markdown и JSON.

Пример использования lift для извлечения данных по схеме
Пример использования lift для извлечения данных по схеме

Ai2 olmOCR 2: Специализированный OCR

olmOCR 2 — это 7-миллиардная OCR-специализированная модель компьютерного зрения и языка от Allen Institute for AI (Ai2). Она преобразует PDF в чистый текст и Markdown, сохраняя порядок чтения. Она обрабатывает таблицы, уравнения и рукописный текст в сложных многоколоночных макетах. Модель обучена с использованием усиленного обучения из проверяемых вознаграждений (RLVR), используя синтетические модульные тесты в качестве сигнала вознаграждения.

olmOCR 2 набирает 82.4 на собственном бенчмарке olmOCR-Bench, что является одним из самых высоких опубликованных результатов в этом наборе. Ai2 оценивает стоимость примерно в 178 долларов за миллион страниц на ваших собственных GPU. Инструментарий и веса allenai/olmOCR-2-7B-1025 распространяются под Apache-2.0. Текущая модель ориентирована на английский язык.

DeepSeek DeepSeek-OCR: Оптимизация токенов

DeepSeek-OCR — это открытая OCR-модель от DeepSeek, выпущенная в октябре 2025 года. Она представляет «оптическое сжатие контекстов» (contexts optical compression), которое представляет текстовые страницы в виде компактных визуальных токенов, а затем декодирует их обратно в текст. Это позволяет обрабатывать длинные документы с гораздо меньшим количеством токенов, чем типичные модели компьютерного зрения и языка.

Она использует DeepEncoder и декодер Mixture-of-Experts (MoE) на 3B, который активирует около 570 миллионов параметров на токен. В зависимости от запроса она выводит обычный текст, Markdown, HTML-таблицы или структурированный JSON, и поддерживает более 100 языков. Код выпущен под лицензией MIT. В январе 2026 года последовала версия DeepSeek-OCR2.

Архитектура модели NuExtract 3 от NuMind
Архитектура модели NuExtract 3 от NuMind

04Общеприменимое решение: Qwen3-VL

Qwen3-VL от Alibaba не является специализированной моделью для документов. Это общая мультимодальная серия, которую многие модели извлечения используют в качестве основы. Вы можете запросить у нее вернуть Markdown, JSON или код со страницы. Большинство размеров выпущены под Apache 2.0. Это гибкий запасной вариант, когда специализированная модель не подходит, хотя она требует больше настройки промптов и предлагает меньше гарантий вывода.

05Сравнение опций

Ниже приведена сводная таблица для быстрого сравнения ключевых характеристик моделей, описанных выше. Обратите внимание, что бенчмарки не являются напрямую сопоставимыми, так как они используют разные наборы данных и метрики.

Интерфейс парсинга документов в Docling от IBM
Интерфейс парсинга документов в Docling от IBM
Модель Организация Размер Назначение Основной вывод Лицензия
lift Datalab 9B Извлечение по схеме JSON по вашей схеме Apache-2.0 код / OpenRAIL-M веса
NuExtract 3 NuMind 4B Схема + OCR JSON + Markdown Открытые веса (см. карточку)
Docling IBM / LF AI Пайплайн Парсинг макета Markdown, JSON, DocTags MIT
Granite-Docling IBM 258M Однократное преобразование DocTags, Markdown Apache 2.0
MinerU OpenDataLab ~1.2B VLM Парсинг макета Markdown, JSON MinerU Open Source License
Marker Datalab Пайплайн Парсинг макета Markdown, JSON, HTML GPL-3.0 код / OpenRAIL-M веса
olmOCR 2 Ai2 7B OCR в текст Plain text, Markdown Apache 2.0
DeepSeek-OCR DeepSeek 3B MoE (~570M active) OCR со сжатием токенов Текст, Markdown, JSON MIT (код)
Qwen3-VL Alibaba 2B–235B Общий VLM Markdown, JSON, код Apache 2.0 (большинство размеров)
⚠️
Важно о бенчмарках. Эти цифры получены из разных наборов данных и не являются напрямую сопоставимыми. 90.2% lift — это точность полей на бенчмарке Datalab. Оценки olmOCR-Bench для olmOCR 2 (82.4) и Marker (76.1) измеряют извлечение контента с помощью модульных тестов. Запускайте свои собственные документы через каждого кандидата перед принятием решения.

06Ключевые выводы

  • Извлечение по схеме (поля в значения) и парсинг документа (макет в JSON) — это разные задачи.
  • lift и NuExtract 3 нацелены на извлечение по схеме JSON; остальные нацелены на парсинг документа.
  • Docling, MinerU, Marker, olmOCR 2 и DeepSeek-OCR парсят документы в структурированный Markdown или JSON.
  • Лицензии сильно различаются: MinerU отказался от AGPL-3.0 в 2026 году, а lift и Marker разделили лицензии на код и веса модели.
  • Опубликованные бенчмарки основаны на разных наборах данных, поэтому рассматривайте кросс-модельные оценки как указательные, а не сравнительные.

07Что это значит на практике

Для российских компаний и разработчиков, работающих в условиях ограничений на доступ к зарубежным облачным API, локальный запуск open-source моделей становится не просто опцией, а необходимостью. Выбор между lift и Docling зависит от того, что именно вы извлекаете. Если вам нужно автоматически заполнять реестры счетов-фактур, lift с его гарантией валидности JSON и высокой точностью полей будет лучшим выбором. Если же вы строите систему поиска по внутренним нормативным документам, Docling или MinerU обеспечат лучшее сохранение структуры и контекста.

Важно также учитывать лицензионные ограничения. Модели с лицензиями типа OpenRAIL-M или Apache-2.0 позволяют коммерческое использование, но могут иметь ограничения на конкуренцию с провайдерами или требования к открытию производных работ. Перед внедрением в production-среду обязательно проведите аудит лицензий и протестируйте модели на репрезентативной выборке ваших документов, так как публичные бенчмарки не всегда отражают качество на специфичных для бизнеса данных.

Экосистема open-source извлечения документов в 2026 году зрелая и разнообразная. Наличие мощных локальных моделей, таких как 9B lift или 7B olmOCR 2, позволяет строить надежные, безопасные и экономичные пайплайны обработки данных, не зависящие от внешних провайдеров. Это открывает новые возможности для автоматизации документооборота и создания AI-ассистентов, работающих с чувствительной информацией.

Источник: MarkTechPost ↗