AIKraft/Skills/OCR-извлечение из PDF

OCR-извлечение из PDF

Extract text from scanned PDFs using optical character recognition

claude-office-skills official Документы

Что делает навык

Навык извлекает текст из отсканированных документов и PDF-файлов с помощью оптического распознавания символов (OCR). Он делает изображения PDF доступными для поиска, оцифровывает бумажные документы и поддерживает пакетную обработку.

Когда применять

  • Извлечение текста из отсканированных документов для создания поисковых версий PDF
  • Оцифровка бумажных документов, включая формы с чекбоксами и таблицы
  • Пакетная обработка нескольких документов из указанной папки
  • Распознавание рукописного текста с оценкой достоверности

Как работает

  1. Определить тип документа (печатный текст, формы, таблицы, рукописный текст) для оценки ожидаемого качества
  2. Выполнить предварительную обработку изображения: проверить разрешение (минимум 300 DPI), контраст, выравнивание и отсутствие искажений
  3. Запустить OCR с указанием языка или автоматическим определением, при необходимости выбрать формат вывода (plain text, структурированные данные, searchable PDF)
  4. Проанализировать результаты, обратив внимание на уровень уверенности (confidence) и раздел 'Uncertain Text' для ручной проверки
  5. Сформировать итоговый отчет с метриками (количество страниц, слов, среднее качество) или выгрузить структурированные данные

Примеры запросов агенту

Извлеки текст из этого отсканированного PDF
Распознай этот документ, сохранив структуру
Извлеки данные из форм и таблиц на страницах 1-10, язык английский

Что понадобится

  • Инструменты OCR: Google Cloud Vision, Amazon Textract, Azure Computer Vision, Adobe Acrobat, ABBYY FineReader, Readiris, Tesseract, pytesseract, EasyOCR или PaddleOCR
  • Качественные изображения документов (разрешение от 300 DPI, четкий контраст, прямое выравнивание)

Описание составлено по SKILL.md навыка, сверено 05.10.2026.

Как подключить

1Скачать навык
# возьмите папку навыка «pdf-ocr-extraction» из репозитория: # https://github.com/claude-office-skills/skills
2Положить папку с SKILL.md к навыкам ассистента
# положите папку навыка туда, где ассистент ищет skills: cp -r pdf-ocr-extraction/ ~/.claude/skills/pdf-ocr-extraction/

Навык — папка с файлом SKILL.md (описание + инструкции) и опциональными скриптами. Ассистент (Claude, Claude Code и совместимые) подхватывает его по описанию и следует шагам.