Релиз модели1 июля 2026 г., 05:17 МСК🤖 Auto

PP-OCRv6: 50 языков и точность до 86.2% в моделях от 1.5M параметров

PaddlePaddle выпустила новое поколение OCR-моделей PP-OCRv6. Семейство из трех моделей (tiny, small, medium) поддерживает 50 языков, использует новый бэкбон PPLCNetV4 и демонстрирует прирост точности до +5.1% по сравнению с версией v5.

Баннер новости 2694

Масштабируемое семейство моделей: от Edge до Server

Главная особенность PP-OCRv6 — гибкость выбора размера модели под конкретные аппаратные ограничения. Семейство включает три уровня сложности, позволяющие балансировать между скоростью инференса и качеством распознавания. Модели доступны в форматах Paddle Inference, ONNX и Safetensors (для интеграции с Hugging Face Transformers).

Модель Параметры Детекция (Hmean) Распознавание (Acc) Сценарии использования
PP-OCRv6_tiny 1.5M 80.6% 73.5% Edge-устройства, мобильные демо, жесткие ограничения по памяти
PP-OCRv6_small 7.7M 84.1% 81.3% Мобильные приложения, десктоп, баланс цена/качество
PP-OCRv6_medium 34.5M 86.2% 83.2% Серверная обработка, промышленные этикетки, сложные документы

Архитектурные новинки: PPLCNetV4 и RepLKFPN

В PP-OCRv6 внедрен единый бэкбон PPLCNetV4 для задач детекции и распознавания, что унифицирует архитектуру семейства. Для детекции текста используется модуль RepLKFPN — легковесная пирамида признаков с большими ядрами, оптимизированная для работы с текстом разного масштаба, наклона и на сложном фоне. Модуль распознавания EncoderWithLightSVTR сочетает локальное моделирование контекста с глобальным вниманием, что критично для разбора плотного текста, спецсимволов и шумных изображений.

Мультиязычность и сравнение с предшественником

Модели версий small и medium поддерживают 50 языков в единой модели, включая упрощенный и традиционный китайский, английский, японский и 46 латинских языков. Это устраняет необходимость в сборке отдельных моделей для каждого языка.

По сравнению с предыдущей флагманской версией PP-OCRv5_server, новая PP-OCRv6_medium показывает существенный прирост метрик:

  • +4.6 п.п. в детекции текста (Hmean)
  • +5.1 п.п. в точности распознавания

Интеграция и запуск

Модели доступны на Hugging Face Hub. Для использования в Python-проектах требуется PaddleOCR версии 3.7+. Поддерживаются три бэкенда инференса:

  • Paddle Inference (по умолчанию, нативный формат)
  • Transformers (через Hugging Face, параметр engine="transformers")
  • ONNX Runtime (параметр engine="onnxruntime")

Результаты работы можно сохранять в виде визуализированных изображений или структурированного JSON, что удобно для пайплайнов RAG, парсинга документов и работы с агентами.

Бенчмарки

БенчмаркPP-OCRv6_mediumPP-OCRv5_server
PP-OCRv6_medium Detection Hmean86.2%81.6%
PP-OCRv6_medium Recognition accuracy83.2%78.1%

Жирным — лучший результат в строке. Источник цифр — официальная публикация.

Источник: Hugging Face blog ↗