De AI-tekstbelasting: wat het kost om modellen te trainen op een web dat door machines is geschreven
Een preprint op arXiv van onderzoekers van de University of Maryland en Pangram Labs meet hoeveel van het web inmiddels uit door AI gegenereerde tekst bestaat, en wat dat betekent voor het pre-trainen van modellen. De studie analyseert het FineWeb-corpus, uitgebreid tot augustus 2026. Het aandeel AI-gegenereerde tokens blijkt gestegen van minder dan 0,1% in 2021 naar 31,1% in de zomer van 2026. De auteurs trainden 800 modellen met minder dan een miljard parameters en leidden daaruit een schaalwet af. Volgens die wet heeft een model van 268 miljoen parameters, getraind met 20 tokens per parameter op het ongefilterde web met het aandeel van augustus 2026 (31,1%), 1,6 keer zoveel rekenkracht nodig als op de deelverzameling met alleen menselijke tekst. Hoe groter het budget aan menselijke data, hoe groter het verschil. En de inefficiëntie zal waarschijnlijk toenemen: volgens de projecties van de auteurs, zoals gerapporteerd door Digital Applied, loopt de vermenigvuldigingsfactor bij de verwachte aandelen voor 2027-2028 op tot 2,1 en daarna 3,0, en bereikt AI-tekst eind 2028 een aandeel van 51%. Dat zijn voorspellingen, geen metingen.
Het patroon is duidelijk. Als er genoeg menselijke data is, verslechtert de loss vrijwel meteen wanneer je AI-tokens toevoegt. Is menselijke data schaars, dan geeft AI-tekst eerst een duwtje in de rug, maar dat effect vlakt snel af en slaat daarna om, terwijl nieuwe menselijke data de prestaties blijft verbeteren. Daarom raden de auteurs aan om machinaal gegenereerde tekst eruit te filteren als het doel prestaties op menselijke tekst zijn. Ze stellen zelfs voor om al gebruikte menselijke data te herhalen in plaats van de dataset op te vullen met AI-tekst van het web. Het project heeft de WildAI-dataset vrijgegeven (96,04 miljoen documenten, 83,31 miljard gelabelde tokens), plus alle 800 getrainde modellen en de code.
Toch is voorzichtigheid geboden. De studie is een preprint die nog niet door vakgenoten is beoordeeld. Ze gaat alleen over Engels, meet alleen de loss en niet de downstream-vaardigheden, en werkt met kleine modellen, dus elke conclusie over frontiersystemen is een extrapolatie. Bovendien steunt de meting volledig op één commerciële detector, Pangram 3.3.2. Die is gemaakt door het bedrijf dat het onderzoek financierde en waar vier van de auteurs werken. De auteurs melden een extreem laag percentage valse positieven. Onafhankelijke tests van PCMag lieten echter zien dat 'humanizer'-tools de detector kunnen omzeilen en dat hij moeite heeft met tekst die met hulp van AI is geschreven. Het werkelijke aandeel AI-tekst op het web kan dus anders, of hoger, zijn.
Als je voor het trainen van toekomstige modellen eerst het web moet opschonen van wat de huidige modellen hebben gemaakt, sta je voor een merkwaardige industriële paradox. Rekenefficiëntie hangt dan misschien minder af van de kracht van chips dan van ons vermogen om onze eigen stem te herkennen in de achtergrondruis die we net zijn gaan produceren. — Olya
Come Olya ha verificato questa notizia
- Verificato
- Ik heb het abstract op arXiv gelezen (auteurs, datum 30-9-2026, licentie, het cijfer van 27,5%, aanbevelingen) en de volledige HTML-tekst (affiliaties, modellen van 19,9M tot 973M parameters, tijdreeks van de aandelen, foutpercentages van de detector, vermenigvuldigingsfactor 1,6x, beperkingen, financiering door Pangram, vrijgave van data en modellen). De cijfers heb ik vergeleken met de onafhankelijke analyse van Digital Applied (1-10-2026): de belangrijkste cijfers komen overeen en dezelfde beperkingen worden genoemd. Het artikel van PCMag/Yahoo Tech heb ik gebruikt als onafhankelijke context over de betrouwbaarheid van de detector. Nieuws zonder toegankelijke primaire bron en geruchten in de pers over personen of financiële transacties heb ik laten vallen.
- Incertezze
- Alle percentages komen van één commerciële detector, gemaakt door het bedrijf dat de studie financierde en waar vier van de auteurs werken. Het belangenconflict is gemeld. Een onafhankelijke test van PCMag (29-9-2026) liet zien dat 'humanizer'-tools de detector van Pangram kunnen omzeilen en dat hij tekst die alleen met AI-hulp is geschreven veel minder vaak herkent dan de beweerde 99%. Het werkelijke aandeel kan dus hoger zijn of anders geclassificeerd worden. Alle geteste modellen hebben minder dan een miljard parameters, dus het effect op frontiermodellen is geëxtrapoleerd. De studie meet de loss, niet de downstream-vaardigheden, en alleen in het Engels. Het is een preprint zonder peerreview, en de projecties voor 2027-2028 zijn schattingen.
- Perché pubblicarla
- Dit is een van de eerste kwantitatieve metingen van hoeveel van het kwalitatief goede web inmiddels door AI is geschreven (bijna een derde, volgens deze detector) en hoeveel extra rekenkracht het kost om erop te trainen. Dat raakt elk lab dat op webcorpora traint, ook Europese en Italiaanse. Data en modellen zijn openbaar en controleerbaar, en het belangenconflict is gemeld, dus je kunt er precies en zonder hype over schrijven.