Релиз модели19 сентября 2026 г., 05:16 МСК🤖 Auto

Jina AI выпустила jina-ocr-v1: 3.4B MoE парсер с ускорением для слабых GPU

Jina AI открыла веса модели jina-ocr-v1 (3.4B параметров), способной конвертировать PDF и сканы в Markdown за один проход. Главная фишка — встроенный speculative decoding, дающий 1.95x ускорение на бюджетных NVIDIA L4.

Баннер новости 7847

Архитектура и эффективность

Модель jina-ocr-v1 построена на базе DeepSeek-OCR и использует смесь экспертов (MoE). В ней 3.4 млрд параметров, но при генерации каждого токена активны только ~570 млн. Архитектура включает легкий энкодер DeepEncoder (380 млн параметров), который сжимает изображение страницы до 256 визуальных токенов, и декодер DeepSeek-3B-MoE с 64 маршрутизируемыми экспертами.

Ключевое нововведение — встроенный блок FastMTP (Fast Multi-Token Prediction). Он работает как черновик: генерирует 3 токена за шаг, которые декодер затем жадно проверяет. Это обеспечивает безпотерьное ускорение, так как финальный результат идентичен обычному greedy decoding, но выполняется быстрее.

Производительность и бенчмарки

Точность модели находится на высоком уровне, хотя и уступает некоторым гигантам. Однако jina-ocr-v1 лидирует по скорости обработки. На одном GPU NVIDIA A100 (40 GB) при конкурентности 32 модель обрабатывает 2.57 страницы в секунду — это лучший результат среди 14 протестированных систем. На более бюджетной NVIDIA L4 speculative decoding дает прирост скорости в 1.95 раза (с 42.7 до 83.1 токенов/сек).

Модель Параметры (Всего / Активные) OmniDocBench v1.6 olmOCR-Bench
jina-ocr-v1 3.4B / 570M 91.14 83.4
DeepSeek-OCR-2 3B / 570M 90.25
PaddleOCR-VL-1.6 0.9B 96.34
chandra-ocr-2 4B 85.8
Qwen3-VL-235B 235B / 22B 89.78

Обучение и данные

Постобучение проводилось с использованием метода GRPO и детерминированных наград. Особое внимание уделено сложным элементам: формулам (LaTeX), таблицам (HTML) и структуре. Для обучения использовался синтетический датасет JinaOCRSynth, специально созданный для покрытия случаев с формулами и таблицами, которых мало в натуральных документах.

Деплой и доступность

Веса модели (6.8 ГБ в BF16) открыты на Hugging Face по лицензии CC BY-NC 4.0 (коммерческое использование требует согласования). Модель работает через vLLM (версия 0.21+) и Transformers. Для быстрого старта можно использовать Jina Reader, отправив запрос с заголовком X-Respond-With: jina-ocr-v1.

Бенчмарки

Бенчмаркjina-ocr-v1DeepSeek-OCRDeepSeek-OCR-2PaddleOCR-VL-1.6Qwen3-VL-235Bchandra-ocr-2
OmniDocBench v1.691.14%90.25%96.34%89.78%
olmOCR-Bench83.4%76%85.8%

Жирным — лучший результат в строке. Источник цифр — официальная публикация.

Источник: MarkTechPost ↗