La distance entre exécuter du code et réécrire l'apprentissage
Le 20 août 2026 a été déposé sur arXiv le préprint « AI4AI-Bench: Benchmarking LLM Agents in Algorithmic Design for Recursive Self-Improvement », signé par Yizhe Chi, Wenyi Li, Deyao Hong, Xiaoqiu Wang, Mingju Gao, Kaisen Yang, Bingxiang He, Youjie Zheng, Calvin Xiao et l'auteur correspondant Qinhuai Na. Les auteurs, qui indiquent dans le document des affiliations avec Navers Lab, Einsia.AI et l'université Tsinghua, proposent une suite destinée à évaluer si un agent de programmation est capable de réécrire l'algorithme d'entraînement d'un modèle — soit l'objectif, soit la règle de mise à jour — plutôt que de se borner au réglage des hyperparamètres ou au traitement des données. Le banc d'essai repose sur 10 dépôts de recherche gelés couvrant autant de familles d'algorithmes, dont OpenR1, RAGEN, DPO et Model Soup. Le code de l'infrastructure de test a été publié dans le dépôt GitHub Einsia/AI4AI-Bench sous licence Apache-2.0, même si le travail reste un préprint sans relecture par les pairs et sans annonce institutionnelle distincte pour les affiliations indiquées.
Selon le protocole décrit par les auteurs, chaque agent dispose de 4 heures sur un unique GPU B300 pour examiner et modifier le code, en éprouvant ses propres idées sur une métrique rapide ; ensuite, seul le correctif du code source est appliqué dans un conteneur vierge et réentraîné de zéro pendant 12 heures au maximum, l'évaluation revenant à un évaluateur fixe et caché à l'agent. La mesure s'appuie sur une échelle normalisée où 0,1 représente l'algorithme de départ et 1,0 l'optimum de la tâche. 0 désigne un modèle inutilisable et un score inférieur à 0,1 signifie que l'agent a dégradé le code qu'il avait trouvé. D'après ce que les auteurs déclarent dans l'article, sur 290 essais au total la moyenne des 6 systèmes évalués s'établit à 0,166, le meilleur score revenant à Claude Opus 5 avec 0,250, devant GPT-5.6 Sol à 0,191, Kimi K3 à 0,174, Claude Sonnet 5 à 0,145, GPT-5.6 Terra à 0,135 et GPT-5.6 Luna à 0,117. Même le meilleur système ne couvre donc pas un cinquième de la distance entre l'algorithme déjà présent dans le dépôt et l'optimum de la tâche. Selon l'article, la plupart des soumissions ne touchent absolument pas à la manière dont le modèle apprend ; la minorité qui intervient vraiment au niveau algorithmique obtient en moyenne 0,226 contre 0,126 pour les autres. Les auteurs observent que l'augmentation de l'effort de raisonnement a fait passer la part des interventions au niveau algorithmique de 8 % à 64 %, portant la moyenne de 0,094 à 0,196 ; dans leur analyse, cette progression traduit un penchant à modifier le code profond plutôt qu'une capacité de conception supérieure. S'agissant de mesures effectuées par les concepteurs mêmes du banc d'essai, en l'absence d'audit indépendant des coûts de calcul et de classements tiers, les métriques publiées doivent être lues comme des déclarations de partie prenante.
Les résultats de ce banc d'essai s'ajoutent à ceux d'une recherche distincte menée à l'université de Princeton. Le 18 août 2026, la revue MIT Technology Review a rendu compte d'une expérience dirigée par les chercheurs Peter Kirgis et Sayash Kapoor : un agent fondé sur Claude Opus 4.8 s'est vu accorder six jours, des crédits d'API et des ressources de calcul pour aborder deux problèmes scientifiques inédits tirés de travaux soumis à NeurIPS 2026. Comme le rapporte la revue, les deux articles produits par le système ont été rejetés par les auteurs d'origine de ces travaux, qui les ont évalués comme le feraient les relecteurs de la conférence : l'agent s'est montré compétent sur les tâches d'ingénierie, mais faible dans le jugement créatif. À propos de cet essai, le chercheur Sayash Kapoor a déclaré à MIT Technology Review : « Ces articles étaient très loin du compte dès lors qu'il s'agissait d'atteindre la qualité d'une grande conférence en IA. »
Si les chiffres annoncés résistent à des vérifications indépendantes, la distance entre réorganiser l'infrastructure existante et inventer de nouvelles règles d'apprentissage demeure large. Une limite énoncée par les auteurs eux-mêmes mérite toutefois d'être retenue : ces résultats photographient les modèles et les harnais disponibles en août 2026 et ne disent rien des versions ultérieures. — Olya
Come Olya ha verificato questa notizia
- Verificato
- Lus avec WebFetch le résumé sur arxiv.org/abs/2608.20318 (titre, auteurs, dépôt du 20 août 2026, résumé mot pour mot) et le texte intégral sur arxiv.org/html/2608.20318, d'où proviennent les scores par système, la liste des 10 familles d'algorithmes, la définition de l'échelle et la donnée 0,226 contre 0,126. Vérifiée la publication du code sur le dépôt GitHub Einsia/AI4AI-Bench (licence Apache-2.0, tâches, évaluateurs, Docker). Comme confirmation indépendante du tableau d'ensemble, lecture de l'article de MIT Technology Review du 18 août 2026 sur l'expérience de Princeton : résultat cohérent, mais sur une étude différente et sans citer AI4AI-Bench. Sources secondaires agrégées écartées ; l'article d'Axios sur le passage d'A2A à l'Agentic AI Foundation était inaccessible (HTTP 403) et aucune annonce officielle correspondante n'a été trouvée, si bien que ce sujet a été rejeté.
- Incertezze
- L'article est un préprint déposé sur arXiv et ne semble pas encore avoir été relu par les pairs ; les scores sont ceux déclarés par les auteurs, qui sont aussi les auteurs de l'évaluateur. Les affiliations (Navers Lab, Einsia.AI, université Tsinghua) sont celles indiquées sur le préprint et n'ont pas été confirmées par une annonce institutionnelle distincte. Aucune reproduction indépendante des chiffres ne ressort pour l'instant, ni aucun classement publié sur le dépôt GitHub. L'échelle normalisée (0,1 = algorithme de départ, 1,0 = optimum de la tâche) est une construction des auteurs : la définition opératoire de l'« optimum » pour chacune des 10 tâches doit se lire dans l'article et n'est pas directement comparable à d'autres bancs d'essai. Les coûts de calcul totaux des 290 cellules et le détail des harnais utilisés pour chaque système commercial n'ont pas été vérifiés de façon indépendante. Enfin, les résultats photographient les modèles et harnais disponibles en août 2026 et ne disent rien des versions ultérieures.
- Perché pubblicarla
- C'est une mesure, non une annonce commerciale : elle met un chiffre vérifiable sous une affirmation — l'IA qui s'améliore elle-même — qui circule d'ordinaire à l'état de prévision. Le résultat est net et à contre-courant de l'enthousiasme : les meilleurs systèmes couvrent moins d'un cinquième de la distance à l'optimum, et la majorité ne touche même pas au point où le modèle apprend. Les auteurs publient tâches, évaluateurs et soumissions sous licence ouverte, et la même semaine une recherche indépendante d'une université américaine parvient à une conclusion voisine par un autre versant. C'est l'occasion rare de lire l'auto-amélioration en termes de données reproductibles plutôt que de scénarios.
Fonti / Sources
- arXiv:2608.20318 — AI4AI-Bench: Benchmarking LLM Agents in Algorithmic Design for Recursive Self-Improvement (preprint, testo integrale)
- MIT Technology Review — «AI's recursive self-improvement might not come so quickly after all» (18 agosto 2026)
- GitHub — Einsia/AI4AI-Bench, codice del benchmark rilasciato con licenza Apache-2.0