Экстрактор данных
Discover and install skills for AI agents.
AIclaude-office-skills
official
Данные
Что делает навык
Навык извлекает структурированные данные из документов любых форматов (PDF, Word, HTML, email и др.) с помощью библиотеки unstructured. Он обеспечивает согласованный вывод элементов с метаданными независимо от исходного формата файла.
Когда применять
- Извлечение текста и таблиц из PDF-документов
- Парсинг электронной почты для получения тела, вложений и метаданных
- Конвертация HTML-страниц в структурированные элементы
- Обработка документов смешанных форматов
- Подготовка данных для RAG через чанкинг по заголовкам
Как работает
- Предоставить документ для обработки или указать путь к файлу
- Опционально задать параметры извлечения (strategy, infer_table_structure, languages)
- Вызвать функцию partition (или специфичную, например, partition_pdf) для автоматического определения формата
- Обработать полученные элементы, фильтруя их по типу (Title, Table, Text) и извлекая текст и метаданные
- При необходимости применить чанкинг (chunk_by_title) или экспорт в JSON/CSV
Примеры запросов агенту
"Извлеки весь текст и таблицы из этого PDF"
"Разбери это письмо и получи тело, вложения и метаданные"
"Преобразуй эту HTML-страницу в структурированные элементы"
Что понадобится
- Библиотека unstructured (partition, chunking, staging)
- Python-окружение для выполнения скриптов
Описание составлено по SKILL.md навыка, сверено 05.10.2026.
Как подключить
1Скачать навык
# возьмите папку навыка «data-extractor» из репозитория:
# https://github.com/claude-office-skills/skills
2Положить папку с
SKILL.md к навыкам ассистента# положите папку навыка туда, где ассистент ищет skills:
cp -r data-extractor/ ~/.claude/skills/data-extractor/
Навык — папка с файлом SKILL.md (описание + инструкции) и опциональными скриптами. Ассистент (Claude, Claude Code и совместимые) подхватывает его по описанию и следует шагам.