Pew Research Center проанализировал около 500 тысяч англоязычных веб-страниц из архива Common Crawl и выяснил, что с запуском ChatGPT доля машинных текстов в интернете резко выросла. В выборке за июль 2026 года около 10% всех страниц содержали явные признаки ИИ-авторства. Если же учитывать только страницы, опубликованные после релиза ChatGPT в конце 2022 года, доля таких текстов превышает треть.
Исследователи использовали детектор Open Pangram для выявления признаков машинного авторства. Анализ показал, что коммерческие сайты с доменом.com содержат ИИ-текст примерно в 10 раз чаще, чем образовательные и государственные ресурсы: 10% против 4,6% у.org и около 1% у.edu и.gov. Это объяснимо: бизнес активнее внедряет генеративные инструменты для контент-маркетинга и SEO, тогда как академические и государственные структуры более консервативны.
| Домен | Доля страниц с ИИ-текстом |
|---|---|
| .com | 10% |
| .org | 4.6% |
| .edu | ~1% |
| .gov | ~1% |
Помимо доли ИИ-текста, исследователи зафиксировали изменения в языке веба. С 2023 года частота употребления тире (em dashes) удвоилась, а оксфордская запятая стала встречаться на 63% чаще. Слова, которые модели предпочитают, — «delve», «interplay», «testament», «pivotal», «landscape», «tapestry», «bolstered», «crucial», «meticulous», «vibrant» — удвоили частоту. Конструкция «it's not just X, it's Y» участилась почти втрое, а в корпоративных PR-документах — вчетверо с 2022 года.
Среди страниц, опубликованных после запуска ChatGPT, доля ИИ-текста превышает треть.

Эти данные согласуются с апрельским исследованием Imperial College London, Internet Archive и Stanford University, которое показало, что около 35% новых веб-сайтов полностью или частично сгенерированы ИИ. Учёные также отметили, что ИИ-тексты семантически более схожи между собой и имеют более позитивный тон, но предостерегли от преувеличения негативных эффектов.
Главная проблема таких исследований — неопределённость самого понятия «ИИ-текст». Спектр включает полностью автоматический контент, человеческие черновики, отполированные ИИ, и тексты, где модель использовалась лишь для нескольких предложений. Детекторы вроде Open Pangram, как отмечает автор The Decoder, дают лишь грубую оценку и часто ошибаются. Это важно, поскольку общественная дискуссия об ИИ-текстах поляризуется: недавнее обсуждение водяных знаков для Claude от Anthropic показало, что использование ИИ-инструментов уже несёт стигму. Понимание «среднего пути» — как люди реально пишут с помощью ИИ — становится всё более актуальным.



