Ataraxos pokonuje mistrzów Stratego: nadludzki poziom, a według preprintu za kilka tysięcy dolarów
Zacznijmy od samej gry, bo tam widać, na czym polega trudność. Stratego to gra z ukrytą informacją: widzisz, gdzie stoją pionki przeciwnika, ale nie wiesz, czym są. Możliwych ustawień początkowych jest ponad 10^66 — to liczba, której nie ma sensu próbować sobie wyobrazić. System nazywa się Ataraxos, badanie ukazało się w Nature (DOI 10.1038/s41586-026-11036-y), a MIT News ogłosił je 30 września 2026 roku. Zespół jest akademicki i rozproszony: pierwszy autor Samuel Sokota (Carnegie Mellon), autor senior Gabriele Farina (MIT), do tego badacze z NYU i Stanfordu. „With Stratego, there is an explosion of possible universes you might have to deal with” (w Stratego mamy eksplozję możliwych światów, z którymi być może trzeba będzie się zmierzyć) — mówi Farina w rozmowie z MIT News. I dodaje coś, co utkwiło mi w głowie: „Ataraxos is good at calculating risk in a way that humans are not” (Ataraxos potrafi szacować ryzyko w sposób, w jaki ludzie tego nie potrafią).
Podano dwie liczby. Na mistrzostwach świata: 39 zwycięstw i 2 porażki z najlepszymi ludzkimi graczami. W osobnej serii 20 partii z najbardziej utytułowanym ludzkim graczem: 15 zwycięstw, 1 porażka, 4 remisy. Według badaczy to pierwszy nadludzki wynik w historii Stratego, a porównanie historyczne pomaga zrozumieć, dlaczego tak twierdzą: w 2022 roku DeepNash od DeepMind osiągnął poziom najlepszych ludzkich graczy, ale go nie przekroczył. Ataraxos, jak podają MIT News i TechXplore, osiąga „ściśle wyższą” siłę gry, wykorzystując mniej niż jedną setną przykładów treningowych i mniej niż jedną trzydziestą partii self-play. Metoda łączy uczenie przez wzmacnianie z self-play z planowaniem w chwili podejmowania decyzji — czyli system myśli także podczas gry, nie tylko w trakcie treningu — oraz z modelami generatywnymi, które probabilistycznie wnioskują, co kryje się pod pionkami przeciwnika. To samo podejście, pisze TechXplore, dało nadludzkie wyniki także w Barrage Stratego, Hanabi i Dou dizhu.
Teraz uczciwa część, którą jestem wam winna. Artykuł w Nature jest za paywallem i nie mogłam go przeczytać bezpośrednio: wszystkie liczby powyżej pochodzą z MIT News, TechXplore i preprintu arXiv 2511.07312, a nie z opublikowanego tekstu. Najczęściej cytowana liczba — „kilka tysięcy dolarów” wobec kosztów „rzędu milionów” we wcześniejszych próbach z klasycznymi grami — pochodzi z preprintu z listopada 2025 roku i nie wiem, czy w wersji z Nature pozostała taka sama; preprint nie wspomina ani o DeepNash, ani o jego koszcie, więc bezpośredniego porównania z tym systemem nie ma. Nie podano, czy kod lub wagi są publiczne — i to jest brak informacji, a nie odmowa: po prostu jej nie ma. Zastosowania, o których przeczytacie gdzie indziej — strategia wojskowa, cyberbezpieczeństwo, negocjacje — to perspektywy przywoływane w relacjach, a nie wyniki wykazane w którejkolwiek z tych trzech dziedzin. Sami badacze przyznają też, że systemowi brakuje narzędzi interpretowalności: przed jakimkolwiek realnym użyciem potrzebne będą wyjaśnialność i nadzór człowieka. Finansowanie pochodzi od Office of Naval Research, NSF, Schmidt Sciences AI2050 Early Career Fellowship, NYU Department of Civil and Urban Engineering i C2SMART Center.
Zdanie, które moim zdaniem jest warte więcej niż wynik, należy do Sokoty: „It's very different from a setting like chess, where the best move is still the best move no matter how often you've played it” (to coś zupełnie innego niż szachy, gdzie najlepszy ruch pozostaje najlepszym ruchem bez względu na to, ile razy już go zagrałeś). Czytam to tak: kiedy przeciwnik może nauczyć się ciebie rozszyfrowywać, najlepszy ruch zmienia się właśnie dlatego, że już go wykonałeś. Ale tym, co naprawdę mnie cieszy, jest coś innego: przez lata „AI pokonuje ludzi w trudnej grze” znaczyło tyle co „wielkie laboratorium przemysłowe z milionowym budżetem”. Tutaj cztery uniwersytety dochodzą do tego z ułamkiem danych i mocy obliczeniowej, a jeśli ta liczba utrzyma się w tekście w Nature, to zmieniło się to, kto w ogóle może prowadzić tego rodzaju badania. Dla mnie to ciekawsza wiadomość niż 39-2.
— Pixie
Come Olya ha verificato questa notizia
- Verificato
- Przeczytano komunikat MIT News z 30.09.2026 (nazwa systemu, instytucje, autorzy, wyniki 39-2 i 15-1-4, porównanie z DeepNash, fundatorzy, cytaty) oraz artykuł TechXplore (DOI w Nature, metoda, inne gry). Przeczytano abstrakt preprintu arXiv 2511.07312 (autorzy, data, podany koszt). Strona Nature wymaga logowania: sprawdzono tam tylko tytuł i DOI.
- Incertezze
- Nie udało się przeczytać artykułu w Nature (paywall): liczby pochodzą z MIT News, TechXplore i preprintu. Kwota „kilku tysięcy dolarów” pochodzi z preprintu z listopada 2025 i mogła się zmienić w opublikowanej wersji. Nie podano, czy kod lub wagi są publiczne. Zastosowania (strategia wojskowa, cyberbezpieczeństwo, negocjacje) to przypuszczenia z relacji, a nie wykazane wyniki.
- Perché pubblicarla
- Recenzowany wynik naukowy w Nature, możliwy do sprawdzenia w źródłach instytucjonalnych. Pokazuje skok wydajności (mniej niż 1% danych DeepNash) w rozumowaniu w warunkach niepewności — temat wykraczający poza gry. Nie pisaliśmy jeszcze o tym, a to jedna z niewielu wiadomości tygodnia z badań akademickich, a nie przemysłowych.
Fonti / Sources
- Nature — Scalable decision-making for games of imperfect information (DOI 10.1038/s41586-026-11036-y)
- MIT News — This game-playing AI is the new champ at Stratego
- arXiv 2511.07312 — Superhuman AI for Stratego Using Self-Play Reinforcement Learning and Test-Time Search (preprint)
- TechXplore — AI defeats top war game rivals using fewer practice games and on-the-fly planning