Масштабируемое семейство моделей: от Edge до Server
Главная особенность PP-OCRv6 — гибкость выбора размера модели под конкретные аппаратные ограничения. Семейство включает три уровня сложности, позволяющие балансировать между скоростью инференса и качеством распознавания. Модели доступны в форматах Paddle Inference, ONNX и Safetensors (для интеграции с Hugging Face Transformers).
| Модель | Параметры | Детекция (Hmean) | Распознавание (Acc) | Сценарии использования |
|---|---|---|---|---|
| PP-OCRv6_tiny | 1.5M | 80.6% | 73.5% | Edge-устройства, мобильные демо, жесткие ограничения по памяти |
| PP-OCRv6_small | 7.7M | 84.1% | 81.3% | Мобильные приложения, десктоп, баланс цена/качество |
| PP-OCRv6_medium | 34.5M | 86.2% | 83.2% | Серверная обработка, промышленные этикетки, сложные документы |
Архитектурные новинки: PPLCNetV4 и RepLKFPN
В PP-OCRv6 внедрен единый бэкбон PPLCNetV4 для задач детекции и распознавания, что унифицирует архитектуру семейства. Для детекции текста используется модуль RepLKFPN — легковесная пирамида признаков с большими ядрами, оптимизированная для работы с текстом разного масштаба, наклона и на сложном фоне. Модуль распознавания EncoderWithLightSVTR сочетает локальное моделирование контекста с глобальным вниманием, что критично для разбора плотного текста, спецсимволов и шумных изображений.
Мультиязычность и сравнение с предшественником
Модели версий small и medium поддерживают 50 языков в единой модели, включая упрощенный и традиционный китайский, английский, японский и 46 латинских языков. Это устраняет необходимость в сборке отдельных моделей для каждого языка.
По сравнению с предыдущей флагманской версией PP-OCRv5_server, новая PP-OCRv6_medium показывает существенный прирост метрик:
- +4.6 п.п. в детекции текста (Hmean)
- +5.1 п.п. в точности распознавания
Интеграция и запуск
Модели доступны на Hugging Face Hub. Для использования в Python-проектах требуется PaddleOCR версии 3.7+. Поддерживаются три бэкенда инференса:
- Paddle Inference (по умолчанию, нативный формат)
- Transformers (через Hugging Face, параметр
engine="transformers") - ONNX Runtime (параметр
engine="onnxruntime")
Результаты работы можно сохранять в виде визуализированных изображений или структурированного JSON, что удобно для пайплайнов RAG, парсинга документов и работы с агентами.
Бенчмарки
| Бенчмарк | PP-OCRv6_medium | PP-OCRv5_server |
|---|---|---|
| PP-OCRv6_medium Detection Hmean | 86.2% | 81.6% |
| PP-OCRv6_medium Recognition accuracy | 83.2% | 78.1% |
Жирным — лучший результат в строке. Источник цифр — официальная публикация.
Источник: Hugging Face blog ↗
