Webclaw сообщает про резкий апгрейд для AI-агентов в формате: 67% меньше токенов и почти мгновенное извлечение контента. 4,820 токенов сырого HTML превращаются в 1,590 в LLM-формате. Это не про косметику интерфейса, а про реальную экономию бюджета запросов.
Слабым звеном обычно была задача «скачать страницу» без мусора и не сжечь лимиты модели. Теперь цель другая: дать только полезный текст, метаданные и изображения в структуре, пригодной для анализа.
Что реально изменилось: чистый контент вместо хаоса HTML и 403-ответов

До этого многие AI-цепочки упирались в ограничения: fetch() на сайте возвращал ошибку 403, а дальше модель тратила время на разбор грязного кода. Webclaw решает это через локальный движок выделения контента и работает быстрее, чем привычные парсеры.
Сильный акцент сделан на качество входа для LLM:
- Chrome-level TLS fingerprinting (похожая на браузерная проверка TLS-подписи) снижает блокировки, когда сервер пинает роботов.
- Noise filtering (фильтр шума) убирает меню, футеры, баннеры и служебные блоки.
- Readability scoring (оценка читаемости) отбирает основной смысловой текст без рекламы и мусора.
- JSON-LD и React/Next-пакеты извлекаются как отдельные блоки для последующей структуры.
- LLM-optimized output (подготовка под языковую модель) дает компактный формат без потери смысла.
| Метрика | webclaw | readability | trafilatura | newspaper3k |
|---|---|---|---|---|
| Точность извлечения | 95.1% | 83.5% | 80.6% | 66.4% |
| Удаление шума | 96.1% | 89.4% | 91.2% | 76.8% |
| Скорость 100KB | 3.2ms | 8.7ms | 18.4ms | ~8.7ms |
| Token efficiency (в сравнении с raw HTML) | -67% | -51% | -55% | -51% |
Итог по таблице короткий: webclaw не просто «ещё один скрейпер», а инструмент, который экономит токены на каждом вызове LLM (large language model — большая языковая модель).
\nЗачем это сделали: AI-агенты страдали не от идей, а от грязного ввода
\nОбычно цепочка ломается раньше, чем в самом решении: введите URL, получите мусорный HTML, потеряйте контекст и токены.
Webclaw перехватывает узкое место: сначала подготовка входных данных, потом уже reasoning (логическое мышление) модели без мусора.
- Локальный режим (без сетевых зависимостей во время чистки) важен для приватности и GDPR-like требований.
- Мгновенная обработка помогает строить дешевые пайплайны в CI/CD для контентных проектов.
- 10 инструментов MCP (Model Context Protocol — протокол передачи инструментов модели) дают агентам прямой доступ к scrape, crawl, map, batch и diff.
- 8 из 10 инструментов работают локально без ключей и API, что снижает точку отказа.
- Cloud fallback срабатывает только при антибот-защите и JS-рендеринге, так вы не привязываете весь процесс к облаку.
Фактически меняется не только скорость, а порядок расходов: меньше случайных обращений, больше полезных. Раньше цена ошибки была в миллионах лишних токенов на больших crawls.
\nКак применить прямо сейчас: быстрый старт и рабочий сценарий для команды
\nСамый практичный путь — запускать вебклинг в том месте, где вы уже используете Claude, Cursor, Windsurf или VS Code.
Рабочий порядок такой:
- Установите CLI: npx create-webclaw для автоматической настройки под ваши AI-инструменты.
- Протестируйте одностраничный режим: webclaw https://пример.com -f llm.
- Проверьте ключевые форматы: markdown, json, text, html и оцените, какой лучше в вашем пайплайне.
- Подключите MCP сервер и передайте агенту команду: найти топ-5 по теме и сравнить цены — это уже end-to-end сценарий.
- Для изменений сайта включите --diff-with snap.json и получите контрольные отчеты по контенту.
Дополнительно есть режимы, которые спасают время исследователю:
- crawl — обход сайта до глубины и лимита страниц без ручной сборки ссылок.
- search/research — поиск и глубокий сбор материалов, если нужно быстро собрать конкурентный бриф.
- brand — вытягивание цветов, шрифтов и логотипов сайта за секунды для маркетинга.
- summarize/extract с локальной моделью через Ollama для автономной аналитики без облака.
Если хотите держать стек максимально чистым, начните с локальной конфигурации и без API-ключей. Затем добавьте OpenAI или Anthropic только там, где нужен точный разбор сложного текста.
Честный итог: это инструмент для тех, кто уже тратит время на AI и хочет вернуть его в виде структуры и предсказуемых результатов. Не скорость ради скорости, а скорость ради точности решения.
Неожиданный поворот: в эпоху AI-агентов ценность перемещается с «сколько умею писать промпты» к «насколько чистыми я подаю данные». webclaw делает вход в интернет для AI таким же дисциплинированным, как хорошо настроенный ETL для данных.
Исходники и документация: github.com/0xMassi/webclaw, подробная методика тестов в benchmarks.
