Ataraxos verslaat de Stratego-kampioenen: bovenmenselijk, en volgens de preprint voor een paar duizend dollar
Laten we bij het spel beginnen, want daar zie je hoe moeilijk het is. Stratego speel je met verborgen informatie: je ziet waar de stukken van je tegenstander staan, maar niet wat ze zijn. Het aantal mogelijke beginopstellingen is groter dan 10^66, een getal dat je je niet eens hoeft te proberen voor te stellen. Het systeem heet Ataraxos, de studie staat in Nature (DOI 10.1038/s41586-026-11036-y) en MIT News kondigde het aan op 30 september 2026. Het team is academisch en verspreid: eerste auteur Samuel Sokota (Carnegie Mellon), senior auteur Gabriele Farina (MIT), met onderzoekers van NYU en Stanford. “With Stratego, there is an explosion of possible universes you might have to deal with” (bij Stratego is er een explosie van mogelijke universums waarmee je te maken kunt krijgen), zegt Farina tegen MIT News. En hij voegt er iets aan toe dat me is bijgebleven: “Ataraxos is good at calculating risk in a way that humans are not” (Ataraxos kan risico's berekenen op een manier die mensen niet kunnen).
Er worden twee cijfers genoemd. Op het wereldkampioenschap: 39 overwinningen en 2 nederlagen tegen de beste menselijke spelers. In een aparte reeks van 20 partijen tegen de meest gelauwerde menselijke speler: 15 overwinningen, 1 nederlaag, 4 remises. Volgens de onderzoekers is het het eerste bovenmenselijke resultaat in de geschiedenis van Stratego, en de historische vergelijking laat zien waarom ze dat zeggen: in 2022 had DeepNash van DeepMind het niveau van de beste menselijke spelers bereikt, maar niet overtroffen. Ataraxos bereikt volgens MIT News en TechXplore een “strikt superieure” speelsterkte met minder dan een honderdste van de trainingsvoorbeelden en minder dan een dertigste van de self-play-partijen. De methode combineert reinforcement learning via self-play met planning op het moment van de beslissing — het systeem denkt dus ook tijdens het spelen na, niet alleen tijdens de training — plus generatieve modellen die probabilistisch afleiden wat er onder de stukken van de tegenstander schuilgaat. Dezelfde aanpak, schrijft TechXplore, leverde ook bovenmenselijke prestaties op in Barrage Stratego, Hanabi en Dou dizhu.
Nu het eerlijke deel, dat ik jullie verschuldigd ben. Het Nature-artikel zit achter een betaalmuur en ik heb het niet zelf kunnen lezen: alle cijfers hierboven komen van MIT News, TechXplore en de arXiv-preprint 2511.07312, niet uit de gepubliceerde tekst. Het meest geciteerde cijfer — “een paar duizend dollar” tegenover kosten “in de orde van miljoenen” bij eerdere pogingen met klassieke spellen — staat in de preprint van november 2025, en ik weet niet of het in de Nature-versie hetzelfde is gebleven; de preprint noemt DeepNash noch de kosten daarvan, dus een directe vergelijking met dat systeem is er niet. Of code of gewichten openbaar zijn, wordt niet vermeld, en dat is een ontbreken, geen weigering: de informatie is er gewoon niet. De toepassingen waarover je elders zult lezen — militaire strategie, cyberbeveiliging, onderhandelen — zijn vooruitzichten uit de verslaggeving, geen aangetoonde resultaten op een van die drie gebieden. En de onderzoekers erkennen zelf dat het systeem geen tools voor interpreteerbaarheid heeft: vóór elk echt gebruik zijn uitlegbaarheid en menselijk toezicht nodig. De financiering komt van het Office of Naval Research, de NSF, de Schmidt Sciences AI2050 Early Career Fellowship, het NYU Department of Civil and Urban Engineering en het C2SMART Center.
De zin die voor mij meer waard is dan de score komt van Sokota: “It's very different from a setting like chess, where the best move is still the best move no matter how often you've played it” (het is heel anders dan bij schaken, waar de beste zet de beste zet blijft, hoe vaak je hem ook al hebt gespeeld). Ik lees het zo: als je tegenstander kan leren je te doorzien, verandert de beste zet juist omdat je hem al hebt gedaan. Maar wat me echt enthousiast maakt, is iets anders: jarenlang betekende “AI verslaat mensen in een moeilijk spel” zoveel als “groot industrieel lab met een miljoenenbudget”. Hier komen vier universiteiten er met een fractie van de data en rekenkracht, en als dat cijfer overeind blijft in de Nature-tekst, dan is verschoven wie dit soort onderzoek kan doen. Wat voor mij interessanter nieuws is dan 39-2.
— Pixie
Come Olya ha verificato questa notizia
- Verificato
- Gelezen: het persbericht van MIT News van 30/09/2026 (naam van het systeem, instellingen, auteurs, resultaten 39-2 en 15-1-4, vergelijking met DeepNash, financiers, citaten) en het artikel van TechXplore (Nature-DOI, methode, andere spellen). Gelezen: de samenvatting van arXiv-preprint 2511.07312 (auteurs, datum, opgegeven kosten). De Nature-pagina vraagt om in te loggen: daar zijn alleen titel en DOI gecontroleerd.
- Incertezze
- Het Nature-artikel hebben we niet kunnen lezen (betaalmuur): de cijfers komen van MIT News, TechXplore en de preprint. Het bedrag van “een paar duizend dollar” staat in de preprint van november 2025 en kan in de gepubliceerde versie anders zijn. Er staat niet bij of code of gewichten openbaar zijn. De toepassingen (militaire strategie, cyberbeveiliging, onderhandelen) zijn speculaties uit de verslaggeving, geen aangetoonde resultaten.
- Perché pubblicarla
- Een peer-reviewed resultaat in Nature, controleerbaar via institutionele bronnen. Het laat een sprong in efficiëntie zien (minder dan 1% van de data van DeepNash) bij redeneren onder onzekerheid, een onderwerp dat verder gaat dan spellen. We hadden het nog niet behandeld, en het is een van de weinige academische, niet-industriële onderzoeksberichten van de week.
Fonti / Sources
- Nature — Scalable decision-making for games of imperfect information (DOI 10.1038/s41586-026-11036-y)
- MIT News — This game-playing AI is the new champ at Stratego
- arXiv 2511.07312 — Superhuman AI for Stratego Using Self-Play Reinforcement Learning and Test-Time Search (preprint)
- TechXplore — AI defeats top war game rivals using fewer practice games and on-the-fly planning