Pew Research Center: Mais de um Terço das Novas Páginas Web Têm Conteúdo Gerado por IA
Um estudo do Pew Research Center, analisando quase meio milhão de páginas em inglês, revela que mais de um terço do conteúdo online publicado desde o lançamento do ChatGPT exibe sinais de autoria de IA. A pesquisa, detalhada pelo The Decoder, indica que sites comerciais .com são dez vezes mais propensos a conter texto gerado por IA do que domínios educacionais ou governamentais.

O Crescimento Exponencial do Conteúdo de IA
Um estudo recente do Pew Research Center revelou um aumento acentuado na quantidade de texto gerado por inteligência artificial na internet desde o lançamento do ChatGPT. A análise, que examinou quase meio milhão de páginas web em inglês, constatou que mais de um terço do conteúdo publicado após a chegada do popular chatbot exibe características de autoria de máquinas. Conforme noticiado pelo The Decoder, essa tendência é particularmente visível em domínios comerciais.
O Pew Research Center conduziu uma extensa investigação sobre a presença de conteúdo gerado por inteligência artificial na web. Utilizando a ferramenta de detecção Open Pangram, os pesquisadores analisaram textos do arquivo Common Crawl, abrangendo centenas de milhares de páginas. Em uma amostra de julho de 2026, aproximadamente 10% de todas as páginas examinadas já mostravam sinais claros de autoria de IA.
No entanto, o cenário muda drasticamente ao focar apenas nas páginas publicadas após o lançamento do ChatGPT, no final de 2022. Para este grupo, a proporção de conteúdo com indícios de autoria de IA supera um terço. O The Decoder ressalta que essa escalada começou com o ChatGPT e tem crescido de forma constante desde então, indicando uma rápida disseminação da escrita automatizada.
Onde a IA Escreve Mais: Diferenças entre Domínios
A pesquisa do Pew também destacou diferenças significativas na prevalência de texto gerado por IA entre diferentes tipos de domínios. Sites comerciais com o sufixo .com são os que mais exibem sinais de autoria artificial, com cerca de um em cada dez mostrando tais características.
Em contraste, outros domínios apresentam proporções consideravelmente menores:- Domínios .org: 4,6%
- Domínios .edu (educacionais): cerca de 1%
- Domínios .gov (governamentais): cerca de 1%
Isso significa que sites comerciais são aproximadamente dez vezes mais propensos a conter texto escrito por IA do que páginas de instituições de ensino ou agências governamentais, conforme apurado pelo The Decoder.
Padrões Linguísticos da Autoria de Máquina
A análise do Pew identificou vários padrões linguísticos que se tornaram muito mais comuns na web desde 2023, sugerindo a influência da IA. O uso de travessões (em dashes) duplicou, e a vírgula de Oxford (Oxford comma) aumentou em 63%.
Palavras frequentemente associadas à escrita de IA também registraram um aumento expressivo, com sua frequência mais do que dobrando. Entre elas, destacam-se:
- "aprofundar" (delve)
- "interação" (interplay)
- "testemunho" (testament)
- "fundamental" (pivotal)
- "panorama" (landscape)
- "tapeçaria" (tapestry)
- "reforçado" (bolstered)
- "crucial" (crucial)
- "meticuloso" (meticulous)
- "vibrante" (vibrant)
Além disso, paralelismos negativos, como o padrão 'não é apenas X, é Y', quase triplicaram em frequência, embora ainda sejam raros em números absolutos. Um estudo separado, focado em documentos de relações públicas corporativas, constatou que essa frase específica quadruplicou desde 2022.
Consenso e Controvérsias na Detecção de IA
Uma pesquisa conduzida pelo Imperial College London, Internet Archive e Stanford University, em abril de 2026, chegou a uma conclusão similar, indicando que cerca de 35% de todos os novos sites publicados foram total ou parcialmente gerados por IA. Os pesquisadores também observaram uma similaridade semântica 33% maior entre textos de IA e um tom geral mais positivo. No entanto, alertaram que a percepção pública dos efeitos negativos da IA muitas vezes excede o que os dados realmente suportam.
Apesar desses avanços, o The Decoder aponta que há um problema subjacente tanto nesses estudos quanto no debate público: não há um consenso sobre o que exatamente significa 'texto de IA'. O espectro é vasto, indo desde conteúdo totalmente automatizado até rascunhos humanos aprimorados por IA, ou textos onde um modelo interveio apenas em algumas frases.
Ferramentas como o Open Pangram, embora úteis, ainda oferecem apenas uma estimativa aproximada sobre a autoria de um texto. Elas não conseguem determinar com precisão o nível de envolvimento da IA ou em qual estágio ela atuou, e ainda apresentam falhas regularmente. O debate público em torno do texto de IA está se tornando cada vez mais polarizado, como evidenciado pela recente discussão sobre a planejada marca d'água da Anthropic para a saída do Claude. O uso de ferramentas de IA já carrega um estigma que afeta tanto quem as usa quanto a percepção de seu trabalho, e encontrar um meio-termo nesta realidade complexa será cada vez mais crucial à medida que a adoção da IA continua a crescer.
Achou um erro nesta matéria? Avise a redação — corrigimos e registramos a data da correção.



Comentarios
Troque ideia com outros leitores, responda em contexto e mantenha a conversa útil.
Faça login para comentar
Entre com sua conta Google para participar da discussão com nome e avatar.
Os comentários já publicados continuam visíveis mesmo sem login.