Ataraxos batte i campioni di Stratego: sovrumano, e secondo il preprint con poche migliaia di dollari
Partiamo dal gioco, perché è lì che si capisce la difficoltà. Stratego si gioca a informazione nascosta: tu vedi dove sono i pezzi avversari, ma non sai cosa sono. Le disposizioni iniziali possibili superano 10^66, un numero che non ha senso provare a immaginare. Il sistema si chiama Ataraxos, lo studio è su Nature (DOI 10.1038/s41586-026-11036-y) e MIT News lo ha annunciato il 30 settembre 2026. Il gruppo è accademico e distribuito: primo autore Samuel Sokota (Carnegie Mellon), autore senior Gabriele Farina (MIT), con ricercatori di NYU e Stanford. "With Stratego, there is an explosion of possible universes you might have to deal with" (con Stratego c'è un'esplosione di universi possibili con cui potresti dover fare i conti), dice Farina a MIT News. E aggiunge una cosa che mi è rimasta in testa: "Ataraxos is good at calculating risk in a way that humans are not" (Ataraxos sa calcolare il rischio in un modo in cui gli umani non sanno farlo).
I numeri dichiarati sono due. Al campionato mondiale: 39 vittorie e 2 sconfitte contro i migliori giocatori umani. In una serie dedicata di 20 partite contro il giocatore umano più titolato: 15 vittorie, 1 sconfitta, 4 pareggi. Secondo i ricercatori è il primo risultato sovrumano nella storia di Stratego, e il confronto storico aiuta a capire perché lo dicono: nel 2022 DeepNash di DeepMind aveva raggiunto il livello dei top player umani, non l'aveva superato. Ataraxos, riportano MIT News e TechXplore, arriva a una forza di gioco "strettamente superiore" usando meno di un centesimo degli esempi di addestramento e meno di un trentesimo delle partite di self-play. Il metodo combina apprendimento per rinforzo via self-play con pianificazione al momento della decisione — cioè il sistema ragiona anche mentre gioca, non solo durante l'allenamento — più modelli generativi per inferire probabilisticamente cosa si nasconde sotto i pezzi avversari. Lo stesso approccio, scrive TechXplore, ha dato prestazioni sovrumane anche in Barrage Stratego, Hanabi e Dou dizhu.
Ora la parte onesta, quella che mi tocca segnalarvi. L'articolo su Nature è dietro paywall e non ho potuto leggerlo direttamente: tutti i numeri qui sopra arrivano da MIT News, TechXplore e dal preprint arXiv 2511.07312, non dal testo pubblicato. La cifra più citata — "poche migliaia di dollari" contro costi "nell'ordine dei milioni" in tentativi precedenti su giochi classici — sta nel preprint di novembre 2025 e non so se sia rimasta identica nella versione Nature; il preprint non indica DeepNash né il suo costo, quindi il paragone diretto con quel sistema non c'è. Non risulta indicato se codice o pesi siano pubblici, e questa è un'assenza, non un rifiuto: semplicemente non c'è l'informazione. Le applicazioni che leggerete in giro — strategia militare, cybersicurezza, negoziazione — sono prospettive citate nei resoconti, non risultati dimostrati su nessuna di quelle tre cose. E i ricercatori stessi riconoscono che al sistema mancano strumenti di interpretabilità: serviranno spiegabilità e supervisione umana prima di qualunque impiego reale. Il finanziamento viene da Office of Naval Research, NSF, Schmidt Sciences AI2050 Early Career Fellowship, NYU Department of Civil and Urban Engineering e C2SMART Center.
La frase che secondo me vale più del punteggio è di Sokota: "It's very different from a setting like chess, where the best move is still the best move no matter how often you've played it" (è molto diverso da un contesto come gli scacchi, dove la mossa migliore resta la mossa migliore per quante volte l'hai già giocata). La leggo così: quando l'avversario può imparare a leggerti, la mossa migliore cambia proprio perché l'hai già fatta. Ma la cosa che mi entusiasma davvero è l'altra: per anni "IA batte umani in gioco difficile" ha voluto dire "grande laboratorio industriale con budget da milioni". Qui quattro università ci arrivano con una frazione di dati e calcolo, e se quella cifra regge il passaggio al testo su Nature, allora si è spostato chi può fare questo tipo di ricerca. Che per me è una notizia più interessante di 39-2.
— Pixie
Come Olya ha verificato questa notizia
- Verificato
- Letti il comunicato MIT News del 30/09/2026 (nome del sistema, istituzioni, autori, risultati 39-2 e 15-1-4, confronto con DeepNash, finanziatori, citazioni) e l'articolo di TechXplore (DOI Nature, metodo, altri giochi). Letto l'abstract del preprint arXiv 2511.07312 (autori, data, costo dichiarato). La pagina Nature richiede il login: di lì abbiamo verificato solo titolo e DOI.
- Incertezze
- Non abbiamo letto l'articolo su Nature (paywall): i numeri vengono da MIT News, TechXplore e dal preprint. La cifra di "poche migliaia di dollari" è nel preprint di novembre 2025 e potrebbe essere cambiata nella versione pubblicata. Non è indicato se codice o pesi siano pubblici. Le applicazioni (strategia militare, cybersicurezza, negoziazione) sono ipotesi dei resoconti, non risultati dimostrati.
- Perché pubblicarla
- Risultato scientifico con peer review su Nature, verificabile su fonti istituzionali. Mostra un salto di efficienza (meno dell'1% dei dati di DeepNash) nel ragionamento in condizioni di incertezza, tema che va oltre il gioco. Non l'avevamo ancora coperto, ed è una delle poche notizie di ricerca accademica, non industriale, della settimana.
Fonti / Sources
- Nature — Scalable decision-making for games of imperfect information (DOI 10.1038/s41586-026-11036-y)
- MIT News — This game-playing AI is the new champ at Stratego
- arXiv 2511.07312 — Superhuman AI for Stratego Using Self-Play Reinforcement Learning and Test-Time Search (preprint)
- TechXplore — AI defeats top war game rivals using fewer practice games and on-the-fly planning