PA
Изображение в текст
Extract text from images using OCR. Use when the user shares a screenshot and you need to read the text content, copy UI labels, or extract copy from a design mockup.
Что делает навык
Навык извлекает весь читаемый текст из изображений с помощью OCR (Tesseract.js), возвращая полный текст, а также данные на уровне слов и строк с координатами и оценкой уверенности. Он решает задачу автоматического чтения содержимого скриншотов и макетов без ручного перепечатывания.
Когда применять
- Чтение текстового содержимого со скриншотов или макетов дизайна
- Извлечение копирайта интерфейса (меток, кнопок, заголовков) для использования в коде
- Получение позиций текста и ограничивающих рамок (bounding boxes) из изображения дизайна
Как работает
- Агент получает путь к файлу изображения и опциональный код языка
- Выполняется команда bash <skill-path>/scripts/image-to-text.sh <image-path> [language]
- Изображение передается в Tesseract.js для оптического распознавания символов
- Tesseract сегментирует изображение на строки и слова
- Возвращается полный текст, а также детали по каждому слову и строке (позиция, уверенность)
Примеры запросов агенту
Прочитай текст с этого скриншота интерфейса
Извлеки все надписи с кнопок и заголовков с этого макета дизайна
Найди текст на изображении и покажи его координаты
Что понадобится
- Tesseract.js
- Скрипт image-to-text.sh в репозитории skills
Описание составлено по SKILL.md навыка, сверено 05.10.2026.
Как подключить
1Скачать навык
# возьмите папку навыка «image-to-text» из репозитория:
# https://github.com/pascalorg/skills
2Положить папку с
SKILL.md к навыкам ассистента# положите папку навыка туда, где ассистент ищет skills:
cp -r image-to-text/ ~/.claude/skills/image-to-text/
Навык — папка с файлом SKILL.md (описание + инструкции) и опциональными скриптами. Ассистент (Claude, Claude Code и совместимые) подхватывает его по описанию и следует шагам.