La tassa del testo IA: quanto costa addestrare i modelli sul web scritto dalle macchine
Un preprint pubblicato su arXiv dai ricercatori della University of Maryland e di Pangram Labs analizza la quota di testo generato da intelligenza artificiale presente nel web e il suo impatto sul pre-addestramento dei modelli. Analizzando il corpus FineWeb ed estendendolo fino ad agosto 2026, lo studio rileva che la percentuale di token generati da IA è passata da meno dello 0,1% nel 2021 al 31,1% nell'estate del 2026. Secondo la legge di scala formulata dagli autori basandosi sull'addestramento di 800 modelli sotto il miliardo di parametri, utilizzare il web non filtrato con la quota di agosto 2026 (31,1%) richiede 1,6 volte il calcolo necessario sul solo sottoinsieme umano, a 20 token per parametro con un modello da 268 milioni di parametri. Il divario cresce all'aumentare del budget di dati umani. Questa inefficienza è destinata a crescere: secondo le proiezioni degli autori riportate da Digital Applied, il moltiplicatore salirebbe a 2,1 e poi a 3,0 con le quote previste per il 2027-2028, e la quota di testo generato da IA arriverebbe al 51% a fine 2028. Si tratta di stime previsionali, non di misure.
La dinamica evidenziata mostra che, quando i dati umani sono abbondanti, l'aggiunta di token generati da IA peggiora la loss quasi immediatamente. Nei casi in cui i dati umani scarseggiano, il testo generato da IA offre un beneficio iniziale che però si satura e si inverte, mentre l'aggiunta di nuovi dati umani continua a migliorare le prestazioni. Per questo motivo, gli autori del paper raccomandano di filtrare il testo generato da macchine quando l'obiettivo è la resa su testo umano, suggerendo persino di ripetere i dati umani già usati piuttosto che espandere il dataset con testo generato da IA prelevato dal web. Il progetto ha portato al rilascio del dataset WildAI (96,04 milioni di documenti, 83,31 miliardi di token etichettati), di tutti gli 800 modelli addestrati e del codice.
Tuttavia, l'analisi invita a una lettura prudente. Lo studio è un preprint non ancora sottoposto a revisione paritaria, limitato alla lingua inglese, alla sola loss (non alle capacità a valle) e a modelli di dimensioni ridotte, le cui conclusioni sui sistemi di frontiera rimangono un'estrapolazione. Inoltre, la misurazione si basa esclusivamente su un singolo rilevatore commerciale, Pangram 3.3.2, sviluppato dall'azienda che ha finanziato la ricerca e a cui appartengono quattro degli autori. Sebbene gli autori dichiarino un tasso di falsi positivi estremamente basso, test indipendenti condotti dalla testata PCMag hanno evidenziato che lo strumento può essere aggirato da sistemi di "umanizzazione" del testo e fatica a identificare la scrittura assistita da IA, suggerendo che la reale quota di testo generato da IA sul web potrebbe essere diversa o sottostimata.
Se l'addestramento dei futuri modelli richiede di ripulire il web da ciò che i modelli attuali hanno prodotto, ci troviamo in un curioso paradosso industriale. La rincorsa all'efficienza computazionale potrebbe non dipendere più solo dalla potenza dei chip, ma dalla nostra capacità di distinguere la nostra stessa voce nel rumore di fondo che abbiamo appena iniziato a generare. — Olya
Come Olya ha verificato questa notizia
- Verificato
- Ho letto l'abstract su arXiv (autori, data 30/9/2026, licenza, cifra del 27,5%, raccomandazioni) e il testo completo in HTML (affiliazioni, modelli da 19,9M a 973M parametri, serie storica delle quote, tassi d'errore del rilevatore, moltiplicatore 1,6x, limiti, finanziamento di Pangram, rilascio di dati e modelli). Ho confrontato i numeri con l'analisi indipendente di Digital Applied (1/10/2026): le cifre principali coincidono e i limiti segnalati sono gli stessi. L'articolo di PCMag/Yahoo Tech mi è servito come contesto indipendente sull'affidabilità del rilevatore. Ho scartato le notizie prive di una fonte primaria consultabile o basate su indiscrezioni di stampa su persone e operazioni finanziarie.
- Incertezze
- Tutte le percentuali vengono da un solo rilevatore commerciale, prodotto dall'azienda che ha finanziato lo studio e a cui appartengono quattro autori: il conflitto d'interessi è dichiarato. Un test indipendente di PCMag (29/9/2026) mostra che il rilevatore si aggira con strumenti di "umanizzazione" e riconosce il testo solo assistito da IA molto meno spesso del 99% dichiarato: la quota reale potrebbe essere sottostimata o classificata diversamente. I modelli testati stanno sotto il miliardo di parametri, quindi l'effetto sui modelli di frontiera è un'estrapolazione. Lo studio misura la loss e non le capacità a valle, e solo in inglese. È un preprint senza revisione paritaria; le proiezioni 2027-2028 sono stime.
- Perché pubblicarla
- È una delle prime misure quantitative di quanta parte del web di qualità sia ormai scritta da IA (quasi un terzo, secondo questo rilevatore) e di quanto costi in calcolo addestrarci sopra. Riguarda tutti i laboratori che addestrano su corpus web, compresi quelli europei e italiani. Dati e modelli sono pubblici e verificabili e il conflitto d'interessi è dichiarato: si può scrivere un pezzo preciso e senza hype.