AIKraft/Skills/Веб-скрапинг Scrapy

Веб-скрапинг Scrapy

Expert guidance for building web scrapers and crawlers using the Scrapy Python framework with best practices for spider development, data extraction, and pipeline management.

mindrally official Данные

Что делает навык

Навык предоставляет экспертные рекомендации по созданию масштабируемых веб-скраперов и краулеров на Python с использованием фреймворка Scrapy. Он охватывает разработку пауков, извлечение данных, управление пайплайнами и обход антибот-защит.

Когда применять

  • Разработка пауков для извлечения структурированных данных с веб-сайтов с использованием CSS-селекторов и XPath.
  • Настройка пайплайнов для валидации, очистки и сохранения данных в JSON, CSV или базы данных.
  • Обработка JavaScript-контента на сайтах с использованием Scrapy-Splash или Scrapy-Playwright.
  • Настройка распределенного краулинга с помощью Scrapy-Redis и ротации прокси для масштабирования.
  • Реализация этических практик скрапинга, включая соблюдение robots.txt и управление частотой запросов.

Как работает

  1. Создать структуру проекта с файлами items.py, middlewares.py, pipelines.py, settings.py и папкой spiders.
  2. Написать код паука с использованием ItemLoader для извлечения данных через CSS или XPath в объекты Item.
  3. Настроить settings.py, включив AUTOTHROTTLE, CONCURRENT_REQUESTS_PER_DOMAIN и ROBOTSTXT_OBEY.
  4. Реализовать Item Pipelines для валидации данных (например, проверка наличия обязательных полей) и хранения.
  5. При необходимости интегрировать middleware для ротации User-Agent, прокси или рендеринга JavaScript.
  6. Протестировать логику парсинга с помощью unit-тестов и scrapy.contracts, используя кэшированные ответы.

Примеры запросов агенту

Создай паука Scrapy для извлечения названий и цен товаров с сайта, используя ItemLoader и CSS-селекторы.
Настрой настройки Scrapy для production: включи Autothrottle, кэширование HTTP и ограничение запросов на домен.
Как обработать JavaScript-рендеринг в Scrapy с помощью Scrapy-Playwright или Scrapy-Splash?

Что понадобится

  • Python и фреймворк Scrapy
  • Дополнительные библиотеки: scrapy-splash, scrapy-playwright, scrapy-redis, scrapy-fake-useragent, itemloaders

Описание составлено по SKILL.md навыка, сверено 05.10.2026.

Как подключить

1Скачать навык
# возьмите папку навыка «scrapy-web-scraping» из репозитория: # https://github.com/mindrally/skills
2Положить папку с SKILL.md к навыкам ассистента
# положите папку навыка туда, где ассистент ищет skills: cp -r scrapy-web-scraping/ ~/.claude/skills/scrapy-web-scraping/

Навык — папка с файлом SKILL.md (описание + инструкции) и опциональными скриптами. Ассистент (Claude, Claude Code и совместимые) подхватывает его по описанию и следует шагам.