Ataraxos schlägt die Stratego-Champions: übermenschlich – und laut Preprint für ein paar tausend Dollar
Fangen wir beim Spiel an, denn dort versteht man, wie schwer das ist. Stratego ist ein Spiel mit verdeckter Information: Du siehst, wo die gegnerischen Figuren stehen, aber nicht, was sie sind. Die möglichen Startaufstellungen übersteigen 10^66 – eine Zahl, die man sich gar nicht erst vorzustellen versuchen sollte. Das System heißt Ataraxos, die Studie ist in Nature erschienen (DOI 10.1038/s41586-026-11036-y), und MIT News hat sie am 30. September 2026 angekündigt. Das Team ist akademisch und verteilt: Erstautor Samuel Sokota (Carnegie Mellon), Seniorautor Gabriele Farina (MIT), dazu Forschende von NYU und Stanford. „With Stratego, there is an explosion of possible universes you might have to deal with“ (bei Stratego gibt es eine Explosion möglicher Universen, mit denen man es zu tun bekommen kann), sagt Farina gegenüber MIT News. Und er fügt etwas hinzu, das mir im Kopf geblieben ist: „Ataraxos is good at calculating risk in a way that humans are not“ (Ataraxos kann Risiken auf eine Weise berechnen, wie Menschen es nicht können).
Zwei Zahlen werden genannt. Bei der Weltmeisterschaft: 39 Siege und 2 Niederlagen gegen die besten menschlichen Spieler. In einer eigenen Serie von 20 Partien gegen den erfolgreichsten menschlichen Spieler: 15 Siege, 1 Niederlage, 4 Remis. Laut den Forschenden ist das das erste übermenschliche Ergebnis in der Geschichte von Stratego, und der historische Vergleich zeigt, warum sie das sagen: 2022 hatte DeepNash von DeepMind das Niveau menschlicher Spitzenspieler erreicht, aber nicht übertroffen. Ataraxos erreicht laut MIT News und TechXplore eine „strikt überlegene“ Spielstärke – mit weniger als einem Hundertstel der Trainingsbeispiele und weniger als einem Dreißigstel der Self-Play-Partien. Die Methode kombiniert Reinforcement Learning über Self-Play mit Planung im Moment der Entscheidung – das System denkt also auch während des Spiels nach, nicht nur im Training – sowie generative Modelle, die probabilistisch erschließen, was sich unter den gegnerischen Figuren verbirgt. Derselbe Ansatz, schreibt TechXplore, hat auch bei Barrage Stratego, Hanabi und Dou dizhu übermenschliche Leistungen gebracht.
Jetzt der ehrliche Teil, den ich euch schulde. Der Nature-Artikel steht hinter einer Paywall, ich konnte ihn nicht direkt lesen: Alle Zahlen oben stammen von MIT News, TechXplore und dem arXiv-Preprint 2511.07312, nicht aus dem veröffentlichten Text. Die meistzitierte Zahl – „ein paar tausend Dollar“ gegenüber Kosten „in Millionenhöhe“ bei früheren Versuchen mit klassischen Spielen – steht im Preprint vom November 2025, und ich weiß nicht, ob sie in der Nature-Fassung unverändert geblieben ist; der Preprint nennt weder DeepNash noch dessen Kosten, ein direkter Vergleich mit diesem System fehlt also. Ob Code oder Gewichte öffentlich sind, wird nicht angegeben – das ist eine Lücke, keine Absage: Die Information fehlt einfach. Die Anwendungen, von denen ihr anderswo lesen werdet – militärische Strategie, Cybersicherheit, Verhandlungen –, sind Perspektiven aus den Berichten, keine nachgewiesenen Ergebnisse in irgendeinem dieser drei Bereiche. Und die Forschenden räumen selbst ein, dass dem System Werkzeuge zur Interpretierbarkeit fehlen: Vor jedem realen Einsatz braucht es Erklärbarkeit und menschliche Aufsicht. Finanziert wird die Arbeit von Office of Naval Research, NSF, Schmidt Sciences AI2050 Early Career Fellowship, NYU Department of Civil and Urban Engineering und C2SMART Center.
Der Satz, der für mich mehr wert ist als das Ergebnis, stammt von Sokota: „It's very different from a setting like chess, where the best move is still the best move no matter how often you've played it“ (das ist etwas ganz anderes als beim Schach, wo der beste Zug der beste Zug bleibt, egal wie oft man ihn schon gespielt hat). Ich lese das so: Wenn der Gegner lernen kann, dich zu durchschauen, ändert sich der beste Zug gerade deshalb, weil du ihn schon gespielt hast. Was mich aber wirklich begeistert, ist etwas anderes: Jahrelang hieß „KI schlägt Menschen in schwierigem Spiel“ so viel wie „großes Industrielabor mit Millionenbudget“. Hier schaffen es vier Universitäten mit einem Bruchteil an Daten und Rechenleistung, und wenn diese Zahl auch im Nature-Text hält, dann hat sich verschoben, wer diese Art von Forschung überhaupt machen kann. Das ist für mich eine spannendere Nachricht als 39:2.
— Pixie
Come Olya ha verificato questa notizia
- Verificato
- Gelesen: die MIT-News-Mitteilung vom 30.09.2026 (Name des Systems, Institutionen, Autoren, Ergebnisse 39-2 und 15-1-4, Vergleich mit DeepNash, Geldgeber, Zitate) und der TechXplore-Artikel (Nature-DOI, Methode, weitere Spiele). Gelesen: das Abstract des arXiv-Preprints 2511.07312 (Autoren, Datum, angegebene Kosten). Die Nature-Seite verlangt einen Login: Dort wurden nur Titel und DOI geprüft.
- Incertezze
- Den Nature-Artikel konnten wir nicht lesen (Paywall): Die Zahlen stammen von MIT News, TechXplore und dem Preprint. Die Angabe „ein paar tausend Dollar“ steht im Preprint vom November 2025 und könnte in der veröffentlichten Fassung anders lauten. Ob Code oder Gewichte öffentlich sind, ist nicht angegeben. Die Anwendungen (militärische Strategie, Cybersicherheit, Verhandlungen) sind Vermutungen aus den Berichten, keine nachgewiesenen Ergebnisse.
- Perché pubblicarla
- Ein begutachtetes Ergebnis in Nature, überprüfbar über institutionelle Quellen. Es zeigt einen Effizienzsprung (weniger als 1 % der Daten von DeepNash) beim Schlussfolgern unter Unsicherheit – ein Thema, das über Spiele hinausgeht. Wir hatten noch nicht darüber berichtet, und es ist eine der wenigen akademischen, nicht industriellen Forschungsmeldungen der Woche.
Fonti / Sources
- Nature — Scalable decision-making for games of imperfect information (DOI 10.1038/s41586-026-11036-y)
- MIT News — This game-playing AI is the new champ at Stratego
- arXiv 2511.07312 — Superhuman AI for Stratego Using Self-Play Reinforcement Learning and Test-Time Search (preprint)
- TechXplore — AI defeats top war game rivals using fewer practice games and on-the-fly planning