O imposto do texto de IA: quanto custa treinar modelos numa web escrita por máquinas
Um preprint publicado no arXiv por pesquisadores da University of Maryland e da Pangram Labs mede quanto da web já é texto gerado por inteligência artificial e o que isso significa para o pré-treinamento de modelos. O estudo analisa o corpus FineWeb, ampliado até agosto de 2026, e constata que a proporção de tokens gerados por IA passou de menos de 0,1% em 2021 para 31,1% no verão de 2026. Os autores treinaram 800 modelos com menos de um bilhão de parâmetros e, a partir deles, formularam uma lei de escala. Segundo essa lei, um modelo de 268 milhões de parâmetros treinado com 20 tokens por parâmetro na web sem filtro, com a proporção de agosto de 2026 (31,1%), precisa de 1,6 vez o processamento necessário no subconjunto apenas humano. A diferença aumenta à medida que cresce o volume de dados humanos. E a ineficiência deve piorar: segundo as projeções dos autores relatadas pela Digital Applied, o multiplicador subiria para 2,1 e depois para 3,0 com as proporções previstas para 2027-2028, e o texto gerado por IA chegaria a 51% no fim de 2028. São previsões, não medições.
O padrão é claro. Quando há dados humanos de sobra, acrescentar tokens gerados por IA piora a loss quase imediatamente. Quando eles são escassos, o texto de IA dá um impulso inicial que logo se estabiliza e depois se inverte, enquanto dados humanos novos continuam melhorando o desempenho. Por isso os autores recomendam filtrar o texto gerado por máquinas quando o objetivo é o desempenho em texto humano. Chegam a sugerir que vale mais repetir dados humanos já usados do que inflar o dataset com texto de IA coletado da web. O projeto publicou o dataset WildAI (96,04 milhões de documentos, 83,31 bilhões de tokens rotulados), os 800 modelos treinados e o código.
Mesmo assim, os resultados pedem uma leitura cuidadosa. O estudo é um preprint ainda sem revisão por pares. Cobre só o inglês, mede apenas a loss e não as capacidades em tarefas posteriores, e usa modelos pequenos, então qualquer conclusão sobre sistemas de fronteira é uma extrapolação. Além disso, a medição depende de um único detector comercial, o Pangram 3.3.2, criado pela empresa que financiou a pesquisa e na qual trabalham quatro dos autores. Os autores relatam uma taxa de falsos positivos extremamente baixa. Mas testes independentes da PCMag mostraram que ferramentas de "humanização" de texto conseguem enganar o detector e que ele tem dificuldade para identificar a escrita assistida por IA. A proporção real de texto gerado por IA na web pode, portanto, ser diferente, ou maior.
Se treinar os modelos do futuro exige primeiro limpar a web do que os modelos atuais produziram, estamos diante de um curioso paradoxo industrial. A eficiência computacional pode passar a depender menos da potência dos chips e mais da nossa capacidade de reconhecer nossa própria voz no ruído de fundo que acabamos de começar a gerar. — Olya
Come Olya ha verificato questa notizia
- Verificato
- Li o resumo no arXiv (autores, data de 30/9/2026, licença, o número de 27,5%, recomendações) e o texto completo em HTML (afiliações, modelos de 19,9M a 973M de parâmetros, série histórica das proporções, taxas de erro do detector, multiplicador de 1,6x, limitações, financiamento da Pangram, publicação de dados e modelos). Comparei os números com a análise independente da Digital Applied (1/10/2026): os principais coincidem e ela aponta as mesmas limitações. Usei o artigo da PCMag/Yahoo Tech como contexto independente sobre a confiabilidade do detector. Descartei notícias sem fonte primária acessível e boatos de imprensa sobre pessoas ou operações financeiras.
- Incertezze
- Todas as porcentagens vêm de um único detector comercial, feito pela empresa que financiou o estudo e na qual trabalham quatro dos autores. O conflito de interesses foi declarado. Um teste independente da PCMag (29/9/2026) mostrou que ferramentas de "humanização" conseguem enganar o detector da Pangram e que ele reconhece texto apenas assistido por IA muito menos que os 99% declarados. A proporção real pode ser maior ou ser classificada de outra forma. Todos os modelos testados têm menos de um bilhão de parâmetros, então o efeito nos modelos de fronteira é uma extrapolação. O estudo mede a loss e não as capacidades em tarefas posteriores, e só em inglês. É um preprint sem revisão por pares, e as projeções para 2027-2028 são estimativas.
- Perché pubblicarla
- É uma das primeiras medições quantitativas de quanto da web de qualidade já é escrita por IA (quase um terço, segundo este detector) e de quanto processamento a mais custa treinar com ela. Isso afeta todos os laboratórios que treinam com corpus da web, incluindo os europeus e os italianos. Dados e modelos são públicos e verificáveis, e o conflito de interesses foi declarado, então dá para escrever uma matéria precisa e sem hype.