La taxe du texte IA : ce que coûte l'entraînement des modèles sur un web écrit par des machines
Un preprint publié sur arXiv par des chercheurs de l'University of Maryland et de Pangram Labs mesure la part de texte généré par l'intelligence artificielle sur le web et ce que cela implique pour le pré-entraînement des modèles. L'étude porte sur le corpus FineWeb, prolongé jusqu'en août 2026. Elle constate que la proportion de tokens générés par IA est passée de moins de 0,1 % en 2021 à 31,1 % à l'été 2026. Les auteurs ont entraîné 800 modèles de moins d'un milliard de paramètres et en ont tiré une loi d'échelle. D'après cette loi, un modèle de 268 millions de paramètres entraîné à 20 tokens par paramètre sur le web non filtré, avec la proportion d'août 2026 (31,1 %), demande 1,6 fois le calcul nécessaire sur le seul sous-ensemble humain. L'écart augmente avec le volume de données humaines. Et l'inefficacité devrait s'aggraver : selon les projections des auteurs rapportées par Digital Applied, le multiplicateur grimperait à 2,1 puis à 3,0 avec les proportions attendues pour 2027-2028, et le texte généré par IA atteindrait 51 % fin 2028. Ce sont des prévisions, pas des mesures.
La tendance est nette. Quand les données humaines abondent, ajouter des tokens générés par IA dégrade la loss presque aussitôt. Quand elles manquent, le texte IA donne d'abord un coup de pouce, mais l'effet plafonne vite puis s'inverse, alors que de nouvelles données humaines continuent d'améliorer les performances. Les auteurs recommandent donc de filtrer le texte produit par des machines quand l'objectif est la performance sur du texte humain. Ils suggèrent même de réutiliser des données humaines déjà vues plutôt que de gonfler le jeu de données avec du texte IA récupéré sur le web. Le projet a publié le jeu de données WildAI (96,04 millions de documents, 83,31 milliards de tokens étiquetés), les 800 modèles entraînés et le code.
Ces résultats demandent toutefois une lecture prudente. L'étude est un preprint qui n'a pas encore été relu par des pairs. Elle ne porte que sur l'anglais, ne mesure que la loss et pas les capacités en aval, et s'appuie sur de petits modèles : toute conclusion sur les systèmes de pointe reste une extrapolation. Surtout, la mesure repose sur un seul détecteur commercial, Pangram 3.3.2, conçu par l'entreprise qui a financé la recherche et qui emploie quatre des auteurs. Les auteurs annoncent un taux de faux positifs extrêmement bas. Mais des tests indépendants de PCMag ont montré que des outils d'« humanisation » de texte parviennent à tromper le détecteur et qu'il repère mal l'écriture assistée par IA. La part réelle de texte généré par IA sur le web pourrait donc être différente, voire plus élevée.
Si l'entraînement des modèles de demain impose de nettoyer d'abord le web de ce que les modèles d'aujourd'hui ont produit, nous voilà face à un curieux paradoxe industriel. L'efficacité de calcul pourrait dépendre moins de la puissance des puces que de notre capacité à reconnaître notre propre voix dans le bruit de fond que nous venons tout juste de commencer à produire. — Olya
Come Olya ha verificato questa notizia
- Verificato
- J'ai lu le résumé sur arXiv (auteurs, date du 30/9/2026, licence, le chiffre de 27,5 %, recommandations) et le texte complet en HTML (affiliations, modèles de 19,9 M à 973 M de paramètres, série historique des proportions, taux d'erreur du détecteur, multiplicateur de 1,6x, limites, financement par Pangram, publication des données et des modèles). J'ai confronté les chiffres à l'analyse indépendante de Digital Applied (1/10/2026) : les principaux concordent et elle relève les mêmes limites. L'article de PCMag/Yahoo Tech m'a servi de contexte indépendant sur la fiabilité du détecteur. J'ai écarté les informations sans source primaire consultable ainsi que les rumeurs de presse sur des personnes ou des opérations financières.
- Incertezze
- Tous les pourcentages proviennent d'un seul détecteur commercial, fabriqué par l'entreprise qui a financé l'étude et qui emploie quatre des auteurs. Le conflit d'intérêts est déclaré. Un test indépendant de PCMag (29/9/2026) a montré que des outils d'« humanisation » parviennent à tromper le détecteur Pangram et qu'il repère le texte simplement assisté par IA bien moins souvent que les 99 % annoncés. La part réelle pourrait donc être plus élevée, ou classée autrement. Tous les modèles testés ont moins d'un milliard de paramètres : l'effet sur les modèles de pointe est extrapolé. L'étude mesure la loss et non les capacités en aval, et uniquement en anglais. C'est un preprint sans relecture par les pairs, et les projections pour 2027-2028 sont des estimations.
- Perché pubblicarla
- C'est l'une des premières mesures chiffrées de la part du web de qualité désormais écrite par l'IA (près d'un tiers selon ce détecteur) et du surcoût en calcul pour s'entraîner dessus. Cela concerne tous les laboratoires qui entraînent sur des corpus web, y compris en Europe et en Italie. Les données et les modèles sont publics et vérifiables, et le conflit d'intérêts est déclaré : on peut en tirer un article précis et sans emballement.