Исследование Pew Research, опубликованное на этой неделе, зафиксировало переломный момент в создании веб-контента: более трети страниц, появившихся в интернете после запуска ChatGPT в ноябре 2022 года, показывают признаки авторства искусственного интеллекта. Цифра в 35% говорит о том, что генеративный ИИ перестал быть инструментом энтузиастов и превратился в рабочую лошадку массового производства контента.
Важный нюанс методологии: первоначальный выборочный анализ 10 тысяч случайных страниц показал только 10% признаков AI-авторства, потому что в эту выборку попадали и старые страницы, созданные до эры генеративного ИИ. Когда исследователи отфильтровали архивный контент и сосредоточились только на страницах, опубликованных после ноября 2022 года, цифра подскочила до 35%. Это различие крайне существенно: оно показывает, что речь идёт не об общей засорённости веба AI-текстом, а о кардинальной смене практик в недавний период.
Исследование использовало Common Crawl — открытый архив веб-страниц — и технологию Open Pangram для детектирования AI-контента. Данные собирались примерно за пять лет, но аналитический фокус сместился на период после ChatGPT. Разброс по доменам оказался показательным: коммерческие .com домены содержат признаки AI-авторства в 10 раз чаще, чем государственные .gov и образовательные .edu сайты (оба около 1%), а некоммерческие .org находятся на уровне 4,6%. Это отражает реальность: бизнес-сегмент первым массово внедрил AI для масштабирования контента, тогда как академия и госструктуры двигаются медленнее.
Само собой, детекторы AI несовершенны и способны ошибаться в обе стороны. Но на таких масштабах даже с допусками на ошибки направление тренда ясно. Pew заметил и косвенные признаки: в последние годы выросла частота использования em-дашей, оксфордских запятых и фраз вроде «это не X, это Y» — типичные артефакты стиля языковых моделей. Один из признаков, что детектирование срабатывает не просто так.
Контекст усугубляет картину: это исследование вышло вскоре после того, как Cloudflare зафиксировала, что бот-трафик впервые превысил человеческий трафик в интернете. Получается замкнутый цикл — машины пишут контент, машины его читают. Для качества информации в сети это плохая новость, для SEO-оптимизации и заполнения ниш контентом это работает вполне эффективно.
Для российского бизнеса этот тренд уже реальность. Агентства контента, маркетинговые команды, медиа-холдинги активно экспериментируют с автоматизацией текстопроизводства. Инструменты вроде локализованных версий ChatGPT или специализированные платформы для автоматизации контента позволяют быстро наполнять каталоги товаров, писать базовые новости, генерировать варианты заголовков и описаний. В e-commerce, где каждый SKU требует десятков текстовых элементов, это экономит недели работы. E-learning, IT-документация, внутренние системы управления контентом — везде AI закрывает рутину. Главное условие: человек всё равно должен отвечать за финальный результат, особенно если контент идёт в публичное пространство.
Вопрос, который неизбежно встанет перед регуляторами и площадками, — требуется ли маркировка AI-контента. Сегодня таких обязательных требований нет, но платформы вроде Steam уже экспериментируют с полем для указания использования ИИ. Если такие требования появятся в России (что маловероятно в ближайший год, но возможно в перспективе), это изменит математику для издателей: скрывать AI-авторство будет сложнее и рискованнее.
Суть в том, что 35% — это уже не тренд, а норма. Это означает, что AI перешёл от инструмента для энтузиастов к инфраструктуре, на которой строится значительная часть сегодняшнего веба. Вопрос больше не в том, использовать ли ИИ для контента, а в том, как сохранить различимость качественного человеческого труда в мире, где машина может за час написать то, на что человеку нужна неделя.