Масштаб явления: от 10% до 35%
Исследовательский центр Pew Research, проанализировав архив Common Crawl, выявил значительный сдвиг в природе веб-контента. В случайной выборке из 10 000 страниц, собранных в июле 2026 года, признаки ИИ-авторства или существенной правки были обнаружены в 10% случаев. Однако эта цифра искажена присутствием старых страниц, созданных до появления генеративных моделей.
Когда исследователи исключили контент, опубликованный до ноября 2022 года (запуска ChatGPT), доля страниц с признаками ИИ-авторства выросла до 35%. Это означает, что каждый третий новый материал в интернете, вероятно, создан или существенно отредактирован нейросетью.
Разрыв между коммерцией и наукой
Самый яркий инсайт исследования — колоссальная разница в уровне автоматизации в зависимости от доменной зоны. Коммерческие сайты массово используют ИИ для генерации контента, тогда как государственные и образовательные ресурсы остаются «островками» человеческого авторства.
| Доменная зона | Доля страниц с признаками ИИ-авторства | Комментарий |
|---|---|---|
| .com | ~10% | Лидер по автоматизации (в 10 раз выше, чем у .edu/.gov) |
| .org | 4.6% | Низкий уровень, но заметный рост |
| .edu / .gov | ~1% | Минимальное использование ИИ-генерации |
Лингвистические маркеры и ложные срабатывания
Для детекции использовалась технология Open Pangram. Помимо стилистических маркеров (эм-дефисы, оксфордские запятые, клише вроде «это не X, это Y»), система выявляет паттерны, характерные для LLM. Важно отметить, что инструменты детекции ИИ подвержены ошибкам: они могут ошибочно классифицировать человеческий текст как машинный. Тем не менее, при масштабе в полмиллиона проанализированных страниц тренд считается статистически значимым.
Контекст: боты читают ботов
Эти данные дополняют картину, нарисованную провайдером Cloudflare, который ранее сообщил, что трафик ботов превысил трафик людей. Ситуация эволюционировала до парадокса: значительная часть веб-контента создается ИИ, а затем потребляется другими ИИ-агентами (скрейперами, поисковыми роботами), что может приводить к «инфляции» цифрового контента и снижению его информационной ценности для человека.
Источник: TechCrunch ↗
