AI-новости30 марта 2026 г., 06:06 МСК

Webclaw упрощает веб-скрейпинг для AI-агентов: 67% меньше токенов и извлечение за миллисекунды

Фото новости

Webclaw сообщает про резкий апгрейд для AI-агентов в формате: 67% меньше токенов и почти мгновенное извлечение контента. 4,820 токенов сырого HTML превращаются в 1,590 в LLM-формате. Это не про косметику интерфейса, а про реальную экономию бюджета запросов.

Слабым звеном обычно была задача «скачать страницу» без мусора и не сжечь лимиты модели. Теперь цель другая: дать только полезный текст, метаданные и изображения в структуре, пригодной для анализа.

Что реально изменилось: чистый контент вместо хаоса HTML и 403-ответов

сравнение raw HTML и webclaw-вывода с 4,820 против 1,590 токенов
Скриншот: github.com
\n

До этого многие AI-цепочки упирались в ограничения: fetch() на сайте возвращал ошибку 403, а дальше модель тратила время на разбор грязного кода. Webclaw решает это через локальный движок выделения контента и работает быстрее, чем привычные парсеры.

Сильный акцент сделан на качество входа для LLM:

  • Chrome-level TLS fingerprinting (похожая на браузерная проверка TLS-подписи) снижает блокировки, когда сервер пинает роботов.
  • Noise filtering (фильтр шума) убирает меню, футеры, баннеры и служебные блоки.
  • Readability scoring (оценка читаемости) отбирает основной смысловой текст без рекламы и мусора.
  • JSON-LD и React/Next-пакеты извлекаются как отдельные блоки для последующей структуры.
  • LLM-optimized output (подготовка под языковую модель) дает компактный формат без потери смысла.
\n\n\n\n\n\n\n\n\n
Метрикаwebclawreadabilitytrafilaturanewspaper3k
Точность извлечения95.1%83.5%80.6%66.4%
Удаление шума96.1%89.4%91.2%76.8%
Скорость 100KB3.2ms8.7ms18.4ms~8.7ms
Token efficiency (в сравнении с raw HTML)-67%-51%-55%-51%
\n

Итог по таблице короткий: webclaw не просто «ещё один скрейпер», а инструмент, который экономит токены на каждом вызове LLM (large language model — большая языковая модель).

\n

Зачем это сделали: AI-агенты страдали не от идей, а от грязного ввода

\n

Обычно цепочка ломается раньше, чем в самом решении: введите URL, получите мусорный HTML, потеряйте контекст и токены.

Webclaw перехватывает узкое место: сначала подготовка входных данных, потом уже reasoning (логическое мышление) модели без мусора.

  • Локальный режим (без сетевых зависимостей во время чистки) важен для приватности и GDPR-like требований.
  • Мгновенная обработка помогает строить дешевые пайплайны в CI/CD для контентных проектов.
  • 10 инструментов MCP (Model Context Protocol — протокол передачи инструментов модели) дают агентам прямой доступ к scrape, crawl, map, batch и diff.
  • 8 из 10 инструментов работают локально без ключей и API, что снижает точку отказа.
  • Cloud fallback срабатывает только при антибот-защите и JS-рендеринге, так вы не привязываете весь процесс к облаку.
\n

Фактически меняется не только скорость, а порядок расходов: меньше случайных обращений, больше полезных. Раньше цена ошибки была в миллионах лишних токенов на больших crawls.

\n

Как применить прямо сейчас: быстрый старт и рабочий сценарий для команды

\n

Самый практичный путь — запускать вебклинг в том месте, где вы уже используете Claude, Cursor, Windsurf или VS Code.

Рабочий порядок такой:

  1. Установите CLI: npx create-webclaw для автоматической настройки под ваши AI-инструменты.
  2. Протестируйте одностраничный режим: webclaw https://пример.com -f llm.
  3. Проверьте ключевые форматы: markdown, json, text, html и оцените, какой лучше в вашем пайплайне.
  4. Подключите MCP сервер и передайте агенту команду: найти топ-5 по теме и сравнить цены — это уже end-to-end сценарий.
  5. Для изменений сайта включите --diff-with snap.json и получите контрольные отчеты по контенту.
\n

Дополнительно есть режимы, которые спасают время исследователю:

  • crawl — обход сайта до глубины и лимита страниц без ручной сборки ссылок.
  • search/research — поиск и глубокий сбор материалов, если нужно быстро собрать конкурентный бриф.
  • brand — вытягивание цветов, шрифтов и логотипов сайта за секунды для маркетинга.
  • summarize/extract с локальной моделью через Ollama для автономной аналитики без облака.
\n

Если хотите держать стек максимально чистым, начните с локальной конфигурации и без API-ключей. Затем добавьте OpenAI или Anthropic только там, где нужен точный разбор сложного текста.

Честный итог: это инструмент для тех, кто уже тратит время на AI и хочет вернуть его в виде структуры и предсказуемых результатов. Не скорость ради скорости, а скорость ради точности решения.

Неожиданный поворот: в эпоху AI-агентов ценность перемещается с «сколько умею писать промпты» к «насколько чистыми я подаю данные». webclaw делает вход в интернет для AI таким же дисциплинированным, как хорошо настроенный ETL для данных.

Исходники и документация: github.com/0xMassi/webclaw, подробная методика тестов в benchmarks.