Главная/Блог/Обзор/Jina OCR v1: Быстрый парсинг документов…
Обзор3 мин чтения · 19 сентября 2026 г.

Jina OCR v1: Быстрый парсинг документов на GPU с 24 ГБ VRAM

Jina AI выпустила модель jina-ocr-v1 (3.4B MoE) с встроенным спекулятивным декодированием. Модель выдает Markdown за один проход и работает на NVIDIA L4/A100 с рекордной скоростью.

Jina OCR v1: Быстрый парсинг документов на GPU с 24 ГБ VRAM

Jina AI, входящая в состав Elastic, представила jina-ocr-v1 — end-to-end модель для визуального парсинга документов. Архитектура основана на MoE (Mixture of Experts) с 3.4 млрд параметров, из которых активны лишь ~570 млн на токен. Главная особенность — встроенный механизм FastMTP (speculative decoding), который кратно увеличивает скорость генерации без потери точности. Модель предназначена для развертывания на бюджетных GPU, таких как NVIDIA L4, и выдает чистый Markdown (с таблицами в HTML и формулами в LaTeX) за один проход.

01Архитектура и эффективность

Модель построена на базе DeepSeek-OCR и использует два ключевых компонента эффективности:

  • DeepEncoder: ~380 млн параметров. Цепочка SAM, 16x convolutional compressor и CLIP-L сжимает изображение страницы 1024×1024 из 4096 патчей всего в 256 визуальных токенов. Поддерживается динамическое разрешение: до 9 локальных тайлов по 100 токенов, что ограничивает максимум страницы 1156 визуальными токенами.
  • Decoder: DeepSeek-3B-MoE. 12 слоев, 64 маршрутизируемых эксперта и 2 общих. При топ-6 маршрутизации активно ~570 млн параметров. Контекстное окно — 32 768 токенов.
💡
Скорость без потерь. FastMTP использует плотный черновик (draft block) на K=3 шага. Декредер проверяет черновики жадным алгоритмом. Если все 3 черновика совпадают, принимается 4 токена. Средний прирост — 2.73 токена за шаг. Результат идентичен обычному greedy decoding, но скорость выше.

02Производительность и бенчмарки

Точность jina-ocr-v1 находится на высоком уровне, хотя и уступает некоторым гигантам (PaddleOCR-VL-1.6, Qwen3-VL-235B). Однако по скорости парсинга она лидирует среди 14 протестированных систем.

Модель Параметры (Total/Active) OmniDocBench v1.6 olmOCR-Bench
jina-ocr-v1 3.4B / 570M 91.14 83.4
DeepSeek-OCR-2 3B / 570M 90.25
DeepSeek-OCR 3B / 570M 76.0
PaddleOCR-VL-1.6 0.9B 96.34
chandra-ocr-2 4B 85.8
Qwen3-VL-235B 235B / 22B 89.78

Результаты скорости (Throughput):

  • NVIDIA A100 40GB (batch=32): 2.57 страниц/сек. Это лучший результат среди всех протестированных систем. Генерация 1085 токенов на страницу.
  • NVIDIA L4 (batch=1): Без спекулятивного декодирования (eager) — 42.7 токенов/с. С FastMTP (K=3) — 83.1 токенов/с (ускорение в 1.95x, acceptance rate 57.6%).
  • NVIDIA L4 + CUDA Graphs: Базовая скорость 158.3 токенов/с. С FastMTP (K=1) — 185.6 токенов/с (ускорение 1.17x).
⚠️
Лицензия. Модель распространяется под лицензией CC BY-NC 4.0. Для коммерческого использования необходимо связаться с Jina AI. Для исследований и некоммерческого использования веса доступны бесплатно.

03Как запустить локально

Веса модели (~6.8 ГБ в BF16) доступны на Hugging Face. Для локального запуска требуется vLLM 0.21+ или Transformers.

Вариант 1: Через Jina Reader (API)
Самый простой способ — отправить URL с заголовком. Это не требует локального GPU.

terminalbash
curl -X POST "https://r.jina.ai/https://example.com/document.pdf" \
-H "X-Respond-With: jina-ocr-v1" \
-H "Accept: text/markdown"

Для парсинга одной страницы из длинного документа используйте заголовок X-Page: 1.

Вариант 2: Локальный запуск через vLLM
Требует установки vLLM версии 0.21 или новее. Необходимо зарегистрировать кастомный код модели.

terminalbash
pip install vllm>=0.21
# Запуск сервера
python -m vllm.entrypoints.api_server \
  --model jinaai/jina-ocr-v1 \
  --trust-remote-code \
  --tensor-parallel-size 1 \
  --gpu-memory-utilization 0.9

При использовании Transformers загружается только MoE-декодер, а веса черновика (draft head) игнорируются, что снижает скорость, но упрощает интеграцию в стандартные пайплайны.

04Обучение и награды (GRPO)

Пост-обучение (post-training) проводилось с использованием GRPO (Group Relative Policy Optimization). Награды (rewards) детерминированы и основаны на коде, сравнивающем вывод с эталонной транскрипцией. Учитываются:

  • Содержание, формулы, таблицы.
  • Структурная валидность и формат.
  • Юнит-тесты и отсутствие повторов.

Для улучшения работы с формулами и таблицами использовался синтетический датасет JinaOCRSynth. Черновая голова (draft head) обучалась последней на замороженном финальном верификаторе.

05Кому подойдёт / что запустится

  • Для кого: Инженеры по данным, разрабатывающие пайплайны извлечения данных (IE) из PDF, сканов и инвойсов. Идеально для сред с ограниченным бюджетом на GPU.
  • Железо: Отлично работает на NVIDIA L4 (24 ГБ VRAM) и A100. Благодаря малому числу активных параметров (570M) модель легко помещается в память даже бюджетных карт, обеспечивая высокую пропускную способность.
  • Результат: Чистый Markdown, HTML-таблицы, LaTeX-формулы. Лучший баланс скорости и качества в классе моделей до 4B параметров.

Источник: MarkTechPost ↗