OCR-извлечение из PDF
Extract text from scanned PDFs using optical character recognition
AIclaude-office-skills
official
Документы
Что делает навык
Навык извлекает текст из отсканированных документов и PDF-файлов с помощью оптического распознавания символов (OCR). Он делает изображения PDF доступными для поиска, оцифровывает бумажные документы и поддерживает пакетную обработку.
Когда применять
- Извлечение текста из отсканированных документов для создания поисковых версий PDF
- Оцифровка бумажных документов, включая формы с чекбоксами и таблицы
- Пакетная обработка нескольких документов из указанной папки
- Распознавание рукописного текста с оценкой достоверности
Как работает
- Определить тип документа (печатный текст, формы, таблицы, рукописный текст) для оценки ожидаемого качества
- Выполнить предварительную обработку изображения: проверить разрешение (минимум 300 DPI), контраст, выравнивание и отсутствие искажений
- Запустить OCR с указанием языка или автоматическим определением, при необходимости выбрать формат вывода (plain text, структурированные данные, searchable PDF)
- Проанализировать результаты, обратив внимание на уровень уверенности (confidence) и раздел 'Uncertain Text' для ручной проверки
- Сформировать итоговый отчет с метриками (количество страниц, слов, среднее качество) или выгрузить структурированные данные
Примеры запросов агенту
Извлеки текст из этого отсканированного PDF
Распознай этот документ, сохранив структуру
Извлеки данные из форм и таблиц на страницах 1-10, язык английский
Что понадобится
- Инструменты OCR: Google Cloud Vision, Amazon Textract, Azure Computer Vision, Adobe Acrobat, ABBYY FineReader, Readiris, Tesseract, pytesseract, EasyOCR или PaddleOCR
- Качественные изображения документов (разрешение от 300 DPI, четкий контраст, прямое выравнивание)
Описание составлено по SKILL.md навыка, сверено 05.10.2026.
Как подключить
1Скачать навык
# возьмите папку навыка «pdf-ocr-extraction» из репозитория:
# https://github.com/claude-office-skills/skills
2Положить папку с
SKILL.md к навыкам ассистента# положите папку навыка туда, где ассистент ищет skills:
cp -r pdf-ocr-extraction/ ~/.claude/skills/pdf-ocr-extraction/
Навык — папка с файлом SKILL.md (описание + инструкции) и опциональными скриптами. Ассистент (Claude, Claude Code и совместимые) подхватывает его по описанию и следует шагам.