Jina AI, входящая в состав Elastic, представила jina-ocr-v1 — end-to-end модель для визуального парсинга документов. Архитектура основана на MoE (Mixture of Experts) с 3.4 млрд параметров, из которых активны лишь ~570 млн на токен. Главная особенность — встроенный механизм FastMTP (speculative decoding), который кратно увеличивает скорость генерации без потери точности. Модель предназначена для развертывания на бюджетных GPU, таких как NVIDIA L4, и выдает чистый Markdown (с таблицами в HTML и формулами в LaTeX) за один проход.
01Архитектура и эффективность
Модель построена на базе DeepSeek-OCR и использует два ключевых компонента эффективности:
- DeepEncoder: ~380 млн параметров. Цепочка SAM, 16x convolutional compressor и CLIP-L сжимает изображение страницы 1024×1024 из 4096 патчей всего в 256 визуальных токенов. Поддерживается динамическое разрешение: до 9 локальных тайлов по 100 токенов, что ограничивает максимум страницы 1156 визуальными токенами.
- Decoder: DeepSeek-3B-MoE. 12 слоев, 64 маршрутизируемых эксперта и 2 общих. При топ-6 маршрутизации активно ~570 млн параметров. Контекстное окно — 32 768 токенов.
02Производительность и бенчмарки
Точность jina-ocr-v1 находится на высоком уровне, хотя и уступает некоторым гигантам (PaddleOCR-VL-1.6, Qwen3-VL-235B). Однако по скорости парсинга она лидирует среди 14 протестированных систем.
| Модель | Параметры (Total/Active) | OmniDocBench v1.6 | olmOCR-Bench |
|---|---|---|---|
| jina-ocr-v1 | 3.4B / 570M | 91.14 | 83.4 |
| DeepSeek-OCR-2 | 3B / 570M | 90.25 | — |
| DeepSeek-OCR | 3B / 570M | — | 76.0 |
| PaddleOCR-VL-1.6 | 0.9B | 96.34 | — |
| chandra-ocr-2 | 4B | — | 85.8 |
| Qwen3-VL-235B | 235B / 22B | 89.78 | — |
Результаты скорости (Throughput):
- NVIDIA A100 40GB (batch=32): 2.57 страниц/сек. Это лучший результат среди всех протестированных систем. Генерация 1085 токенов на страницу.
- NVIDIA L4 (batch=1): Без спекулятивного декодирования (eager) — 42.7 токенов/с. С FastMTP (K=3) — 83.1 токенов/с (ускорение в 1.95x, acceptance rate 57.6%).
- NVIDIA L4 + CUDA Graphs: Базовая скорость 158.3 токенов/с. С FastMTP (K=1) — 185.6 токенов/с (ускорение 1.17x).
03Как запустить локально
Веса модели (~6.8 ГБ в BF16) доступны на Hugging Face. Для локального запуска требуется vLLM 0.21+ или Transformers.
Вариант 1: Через Jina Reader (API)
Самый простой способ — отправить URL с заголовком. Это не требует локального GPU.
curl -X POST "https://r.jina.ai/https://example.com/document.pdf" \
-H "X-Respond-With: jina-ocr-v1" \
-H "Accept: text/markdown"Для парсинга одной страницы из длинного документа используйте заголовок X-Page: 1.
Вариант 2: Локальный запуск через vLLM
Требует установки vLLM версии 0.21 или новее. Необходимо зарегистрировать кастомный код модели.
pip install vllm>=0.21
# Запуск сервера
python -m vllm.entrypoints.api_server \
--model jinaai/jina-ocr-v1 \
--trust-remote-code \
--tensor-parallel-size 1 \
--gpu-memory-utilization 0.9При использовании Transformers загружается только MoE-декодер, а веса черновика (draft head) игнорируются, что снижает скорость, но упрощает интеграцию в стандартные пайплайны.
04Обучение и награды (GRPO)
Пост-обучение (post-training) проводилось с использованием GRPO (Group Relative Policy Optimization). Награды (rewards) детерминированы и основаны на коде, сравнивающем вывод с эталонной транскрипцией. Учитываются:
- Содержание, формулы, таблицы.
- Структурная валидность и формат.
- Юнит-тесты и отсутствие повторов.
Для улучшения работы с формулами и таблицами использовался синтетический датасет JinaOCRSynth. Черновая голова (draft head) обучалась последней на замороженном финальном верификаторе.
05Кому подойдёт / что запустится
- Для кого: Инженеры по данным, разрабатывающие пайплайны извлечения данных (IE) из PDF, сканов и инвойсов. Идеально для сред с ограниченным бюджетом на GPU.
- Железо: Отлично работает на NVIDIA L4 (24 ГБ VRAM) и A100. Благодаря малому числу активных параметров (570M) модель легко помещается в память даже бюджетных карт, обеспечивая высокую пропускную способность.
- Результат: Чистый Markdown, HTML-таблицы, LaTeX-формулы. Лучший баланс скорости и качества в классе моделей до 4B параметров.
Источник: MarkTechPost ↗
