Архитектура и эффективность
Модель jina-ocr-v1 построена на базе DeepSeek-OCR и использует смесь экспертов (MoE). В ней 3.4 млрд параметров, но при генерации каждого токена активны только ~570 млн. Архитектура включает легкий энкодер DeepEncoder (380 млн параметров), который сжимает изображение страницы до 256 визуальных токенов, и декодер DeepSeek-3B-MoE с 64 маршрутизируемыми экспертами.
Ключевое нововведение — встроенный блок FastMTP (Fast Multi-Token Prediction). Он работает как черновик: генерирует 3 токена за шаг, которые декодер затем жадно проверяет. Это обеспечивает безпотерьное ускорение, так как финальный результат идентичен обычному greedy decoding, но выполняется быстрее.
Производительность и бенчмарки
Точность модели находится на высоком уровне, хотя и уступает некоторым гигантам. Однако jina-ocr-v1 лидирует по скорости обработки. На одном GPU NVIDIA A100 (40 GB) при конкурентности 32 модель обрабатывает 2.57 страницы в секунду — это лучший результат среди 14 протестированных систем. На более бюджетной NVIDIA L4 speculative decoding дает прирост скорости в 1.95 раза (с 42.7 до 83.1 токенов/сек).
| Модель | Параметры (Всего / Активные) | OmniDocBench v1.6 | olmOCR-Bench |
|---|---|---|---|
| jina-ocr-v1 | 3.4B / 570M | 91.14 | 83.4 |
| DeepSeek-OCR-2 | 3B / 570M | 90.25 | — |
| PaddleOCR-VL-1.6 | 0.9B | 96.34 | — |
| chandra-ocr-2 | 4B | — | 85.8 |
| Qwen3-VL-235B | 235B / 22B | 89.78 | — |
Обучение и данные
Постобучение проводилось с использованием метода GRPO и детерминированных наград. Особое внимание уделено сложным элементам: формулам (LaTeX), таблицам (HTML) и структуре. Для обучения использовался синтетический датасет JinaOCRSynth, специально созданный для покрытия случаев с формулами и таблицами, которых мало в натуральных документах.
Деплой и доступность
Веса модели (6.8 ГБ в BF16) открыты на Hugging Face по лицензии CC BY-NC 4.0 (коммерческое использование требует согласования). Модель работает через vLLM (версия 0.21+) и Transformers. Для быстрого старта можно использовать Jina Reader, отправив запрос с заголовком X-Respond-With: jina-ocr-v1.
Бенчмарки
| Бенчмарк | jina-ocr-v1 | DeepSeek-OCR | DeepSeek-OCR-2 | PaddleOCR-VL-1.6 | Qwen3-VL-235B | chandra-ocr-2 |
|---|---|---|---|---|---|---|
| OmniDocBench v1.6 | 91.14% | — | 90.25% | 96.34% | 89.78% | — |
| olmOCR-Bench | 83.4% | 76% | — | — | — | 85.8% |
Жирным — лучший результат в строке. Источник цифр — официальная публикация.
Источник: MarkTechPost ↗
