PaddlePaddle/PaddleOCR

Превращайте любые PDF-документы и изображения в структурированные данные для вашего ИИ. Мощный и легкий OCR-инструмент, который соединяет изображения/PDF с LLM. Поддерживает более 100 языков.

Инструменты⭐ 89 908Pythonпоследний релиз: v3.7.0
Открыть на GitHub ↗Сайт проекта ↗

Что это за инструмент

PaddleOCR — это инструмент оптического распознавания символов (OCR) и анализа документов, преобразующий изображения и PDF в структурированные данные (JSON, Markdown) для использования в LLM.

Зачем нужен

Инструмент решает задачу извлечения информации из неструктурированных визуальных данных, обеспечивая высокую точность распознавания текста, формул и таблиц. Он полезен для подготовки данных (RAG) и создания агентов, так как предоставляет готовые к использованию структурированные форматы и координаты элементов.

Что можно реализовать

  • Создание систем RAG (Retrieval-Augmented Generation) для работы с PDF-документами и изображениями
  • Извлечение структурированных данных (таблиц, полей) из сложных документов для LLM
  • Распознавание текста на 100+ языках в сложных сценариях (уличные вывески, документы, промышленные детали)
  • Обработка редких шрифтов, печатей и древних документов с помощью модели PaddleOCR-VL

Ключевые возможности

  • Поддержка 100+ языков через единую модель PP-OCRv6 без необходимости переключения моделей
  • Интеграция с LLM: вывод в форматах JSON и Markdown, совместимость с RAG и Agentic-приложениями
  • Высокая точность на бенчмарках OmniDocBench v1.6 (96.3%) для распознавания текста, формул и таблиц
  • Доступность на CPU, GPU, XPU и NPU, легковесность для развертывания на edge-устройствах и в облаке

👤 Кому подойдёт: Разработчики, создающие AI-приложения (RAG, агенты), инженеры по данным, исследователи в области компьютерного зрения

Релизы

v3.7.0major
🕐 3 мес назад · релиз на GitHub ↗

Выход PP-OCRv6: единая модель на 50 языков с точностью выше VLM и ускорением до 6.1x на Apple M4.

  • Added: Выпущен PP-OCRv6: medium-модель (34.5M параметров) превосходит Qwen3-VL-235B и GPT-5.5 по точности.
  • Added: Единая модель поддерживает 50 языков, включая китайский, английский, японский и 46 латинских языков.
  • Added: Улучшена работа в сложных сценариях: цифровые дисплеи, точечные символы, маркировка шин и промышленный текст.
  • Added: Доступны три версии моделей: tiny (1.5M), small (7.7M) и medium (34.5M) для разных устройств.
  • Added: Значительное ускорение инференса: до 5.2x на CPU (OpenVINO), 6.1x на Apple M4 и 0.13s на A100.
PaddlePaddle/PaddleOCR — GitHub-трекер AIKraft | AIKraft