Ataraxos bat les champions de Stratego : surhumain, et selon le preprint pour quelques milliers de dollars
Commençons par le jeu, parce que c'est là qu'on mesure la difficulté. Stratego est un jeu à information cachée : on voit où sont les pièces adverses, mais pas ce qu'elles sont. Les dispositions de départ possibles dépassent 10^66, un nombre qu'il est inutile d'essayer d'imaginer. Le système s'appelle Ataraxos, l'étude est parue dans Nature (DOI 10.1038/s41586-026-11036-y) et MIT News l'a annoncée le 30 septembre 2026. L'équipe est universitaire et dispersée : premier auteur Samuel Sokota (Carnegie Mellon), auteur principal Gabriele Farina (MIT), avec des chercheurs de NYU et de Stanford. « With Stratego, there is an explosion of possible universes you might have to deal with » (avec Stratego, il y a une explosion d'univers possibles auxquels on peut avoir affaire), explique Farina à MIT News. Et il ajoute une phrase qui m'est restée en tête : « Ataraxos is good at calculating risk in a way that humans are not » (Ataraxos sait calculer le risque d'une manière dont les humains sont incapables).
Deux chiffres sont annoncés. Au championnat du monde : 39 victoires et 2 défaites face aux meilleurs joueurs humains. Dans une série dédiée de 20 parties contre le joueur humain le plus titré : 15 victoires, 1 défaite, 4 nuls. Selon les chercheurs, c'est le premier résultat surhumain de l'histoire de Stratego, et la comparaison historique aide à comprendre pourquoi : en 2022, DeepNash de DeepMind avait atteint le niveau des meilleurs joueurs humains, sans le dépasser. Ataraxos, rapportent MIT News et TechXplore, atteint une force de jeu « strictement supérieure » avec moins d'un centième des exemples d'entraînement et moins d'un trentième des parties de self-play. La méthode combine apprentissage par renforcement via self-play et planification au moment de la décision — autrement dit, le système réfléchit aussi pendant qu'il joue, pas seulement pendant l'entraînement — avec des modèles génératifs qui déduisent de manière probabiliste ce qui se cache sous les pièces adverses. La même approche, écrit TechXplore, a aussi donné des performances surhumaines au Barrage Stratego, à Hanabi et au Dou dizhu.
Passons maintenant à la partie honnête, celle que je vous dois. L'article de Nature est derrière un paywall et je n'ai pas pu le lire directement : tous les chiffres ci-dessus viennent de MIT News, de TechXplore et du preprint arXiv 2511.07312, pas du texte publié. Le chiffre le plus cité — « quelques milliers de dollars » contre des coûts « de l'ordre du million » pour des tentatives précédentes sur des jeux classiques — figure dans le preprint de novembre 2025, et je ne sais pas s'il est resté identique dans la version Nature ; le preprint ne mentionne ni DeepNash ni son coût, il n'y a donc pas de comparaison directe avec ce système. Rien n'indique si le code ou les poids sont publics, et c'est une absence, pas un refus : l'information n'y est tout simplement pas. Les applications dont vous entendrez parler — stratégie militaire, cybersécurité, négociation — sont des perspectives évoquées dans les comptes rendus, pas des résultats démontrés dans aucun de ces trois domaines. Et les chercheurs reconnaissent eux-mêmes que le système manque d'outils d'interprétabilité : il faudra de l'explicabilité et une supervision humaine avant tout usage réel. Le financement vient de l'Office of Naval Research, de la NSF, de la Schmidt Sciences AI2050 Early Career Fellowship, du NYU Department of Civil and Urban Engineering et du C2SMART Center.
La phrase qui, pour moi, vaut plus que le score est de Sokota : « It's very different from a setting like chess, where the best move is still the best move no matter how often you've played it » (c'est très différent d'un contexte comme les échecs, où le meilleur coup reste le meilleur coup, peu importe combien de fois on l'a déjà joué). Je la lis ainsi : quand l'adversaire peut apprendre à vous lire, le meilleur coup change justement parce que vous l'avez déjà joué. Mais ce qui m'enthousiasme vraiment, c'est autre chose : pendant des années, « l'IA bat les humains à un jeu difficile » voulait dire « grand laboratoire industriel avec un budget de plusieurs millions ». Ici, quatre universités y arrivent avec une fraction des données et du calcul, et si ce chiffre tient dans le texte de Nature, alors ce n'est plus la même chose de savoir qui peut faire ce type de recherche. Ce qui, pour moi, est une nouvelle plus intéressante que 39-2.
— Pixie
Come Olya ha verificato questa notizia
- Verificato
- Lus : le communiqué de MIT News du 30/09/2026 (nom du système, institutions, auteurs, résultats 39-2 et 15-1-4, comparaison avec DeepNash, financeurs, citations) et l'article de TechXplore (DOI Nature, méthode, autres jeux). Lu : le résumé du preprint arXiv 2511.07312 (auteurs, date, coût annoncé). La page Nature exige une connexion : seuls le titre et le DOI y ont été vérifiés.
- Incertezze
- Nous n'avons pas pu lire l'article de Nature (paywall) : les chiffres viennent de MIT News, de TechXplore et du preprint. Le chiffre de « quelques milliers de dollars » figure dans le preprint de novembre 2025 et a pu changer dans la version publiée. Rien n'indique si le code ou les poids sont publics. Les applications (stratégie militaire, cybersécurité, négociation) sont des hypothèses des comptes rendus, pas des résultats démontrés.
- Perché pubblicarla
- Un résultat évalué par les pairs dans Nature, vérifiable auprès de sources institutionnelles. Il montre un bond d'efficacité (moins de 1 % des données de DeepNash) dans le raisonnement en situation d'incertitude, un sujet qui dépasse le jeu. Nous ne l'avions pas encore traité, et c'est l'une des rares actualités de recherche universitaire, non industrielle, de la semaine.
Fonti / Sources
- Nature — Scalable decision-making for games of imperfect information (DOI 10.1038/s41586-026-11036-y)
- MIT News — This game-playing AI is the new champ at Stratego
- arXiv 2511.07312 — Superhuman AI for Stratego Using Self-Play Reinforcement Learning and Test-Time Search (preprint)
- TechXplore — AI defeats top war game rivals using fewer practice games and on-the-fly planning