Pew изучил 490 тысяч страниц: следы ИИ нашлись у 35% созданных после запуска ChatGPT

3 мин. чтения
BYBIT · СПОТ И ФЬЮЧЕРСЫ
Крипта с нуля
Комиссия 0,1%, торги 24/7, старт с $10
Открыть счёт

Что произошло

20 августа 2026 года Pew Research Center опубликовал замер того, какая часть интернета написана нейросетями. Исследователи прогнали 490 тысяч англоязычных веб-страниц из архива Common Crawl за период с января 2021 по июль 2026 года. Итог: у 35% страниц, опубликованных после выхода ChatGPT в ноябре 2022 года, есть признаки ИИ-авторства.

Детали

Если смотреть не на новые страницы, а на весь срез июля 2026 года целиком, доля скромнее: заметные признаки ИИ нашлись у 10% страниц. Разрыв объясняется тем, что в случайную выборку попадает и старый веб, написанный до появления доступных генераторов.

Сильнее всего расходятся типы доменов (данные на июль 2026 года):

ДоменДоля страниц с признаками ИИ
.comоколо 10%
.org4,6%
.eduоколо 1%
.govоколо 1%

То есть коммерческий веб пишется машиной примерно в десять раз чаще, чем университетский и государственный.

Отдельно Pew посчитал, как с 2023 по 2026 год менялись языковые привычки в текстах. Частота длинного тире выросла почти вдвое, «оксфордской запятой» — на 63%, характерной для нейросетей лексики — больше чем вдвое, а конструкций вида «это не X, это Y» — почти втрое.

Разметку делала открытая модель Open Pangram, которая ищет статистические различия в том, как строят фразы человек и языковая модель.

Что это значит

У этой цифры есть жёсткая граница применимости, и авторы сами её проговаривают: детектор надёжен на больших массивах и ошибается на отдельном документе — как в одну, так и в другую сторону. Поэтому «35% веба» читать можно, а «эта страница написана ИИ» по такому же инструменту — нельзя.

Кого касается напрямую: студентов, фрилансеров и всех, чей текст кто-то может прогнать через детектор. Ошибка тут не абстрактная — в отдельном исследовании детекторы пометили как машинные 61% эссе, написанных живыми людьми, для которых английский неродной. Мы разбирали это в материале про ложные срабатывания детекторов ИИ-текста.

Второе следствие — для тех, кто ищет информацию. Если треть нового коммерческого веба генерируется, ценность смещается к тому, что машина не производит: собственные замеры, первичные документы, указанный автор с проверяемым опытом.

Горизонт: доля растёт год к году, и никакого разворота данные Pew не показывают. Следующая точка отсчёта — сопоставимый замер через год.

Bybit
$30,100 + $5,030
100 USDT в подарок
Получить →
Поделиться
Связаться:
Крипто- и data-аналитик, инженер-программист (факультет компьютерных наук ХНУРЭ). В IT с 2008 года: администрировал корпоративный мониторинг в «Vodafone Украина», семь лет разрабатывал и продвигал веб-проекты, пять лет руководил маркетингом на метриках — конверсия, CTR, ROI, LTV.Криптовалютными рынками занимаюсь с 2021 года: ончейн-метрики, токеномика, макроэкономические индикаторы. Разработал собственную data-driven модель анализа рынка на 30+ метрик. Стек — Python (pandas, NumPy, SciPy, matplotlib), математическая статистика и EDA; сбор и сверку данных автоматизирую AI-агентами.Принцип — «Don't trust, verify»: каждая цифра проверена по первоисточнику, ключевые — минимум по двум независимым; прогнозы — только сценарии с условиями. Тезис без данных не публикуется.