Ataraxos vence os campeões de Stratego: sobre-humano e, segundo o preprint, com poucos milhares de dólares
Vamos começar pelo jogo, porque é ali que se entende a dificuldade. Stratego é um jogo de informação oculta: você vê onde estão as peças do adversário, mas não sabe o que elas são. As disposições iniciais possíveis passam de 10^66, um número que nem vale a pena tentar imaginar. O sistema se chama Ataraxos, o estudo está na Nature (DOI 10.1038/s41586-026-11036-y) e o MIT News o anunciou em 30 de setembro de 2026. A equipe é acadêmica e distribuída: primeiro autor Samuel Sokota (Carnegie Mellon), autor sênior Gabriele Farina (MIT), com pesquisadores da NYU e de Stanford. “With Stratego, there is an explosion of possible universes you might have to deal with” (com Stratego há uma explosão de universos possíveis com os quais você pode ter de lidar), diz Farina ao MIT News. E acrescenta algo que ficou na minha cabeça: “Ataraxos is good at calculating risk in a way that humans are not” (o Ataraxos sabe calcular o risco de um jeito que os humanos não sabem).
Os números divulgados são dois. No campeonato mundial: 39 vitórias e 2 derrotas contra os melhores jogadores humanos. Numa série dedicada de 20 partidas contra o jogador humano mais premiado: 15 vitórias, 1 derrota e 4 empates. Segundo os pesquisadores, é o primeiro resultado sobre-humano da história do Stratego, e a comparação histórica ajuda a entender por que dizem isso: em 2022, o DeepNash da DeepMind tinha alcançado o nível dos melhores jogadores humanos, mas não o havia superado. O Ataraxos, segundo o MIT News e o TechXplore, chega a uma força de jogo “estritamente superior” usando menos de um centésimo dos exemplos de treinamento e menos de um trigésimo das partidas de self-play. O método combina aprendizado por reforço via self-play com planejamento no momento da decisão — ou seja, o sistema raciocina também enquanto joga, não só durante o treinamento — e modelos generativos para inferir de forma probabilística o que se esconde sob as peças do adversário. A mesma abordagem, escreve o TechXplore, também obteve desempenho sobre-humano em Barrage Stratego, Hanabi e Dou dizhu.
Agora a parte honesta, a que eu devo a vocês. O artigo da Nature está atrás de um paywall e eu não consegui lê-lo diretamente: todos os números acima vêm do MIT News, do TechXplore e do preprint arXiv 2511.07312, não do texto publicado. O número mais citado — “poucos milhares de dólares” contra custos “na casa dos milhões” em tentativas anteriores com jogos clássicos — está no preprint de novembro de 2025, e não sei se permaneceu idêntico na versão da Nature; o preprint não menciona o DeepNash nem o custo dele, então não há comparação direta com esse sistema. Não consta se o código ou os pesos são públicos, e isso é uma ausência, não uma recusa: a informação simplesmente não está lá. As aplicações que vocês vão ler por aí — estratégia militar, cibersegurança, negociação — são perspectivas citadas nas reportagens, não resultados demonstrados em nenhuma dessas três áreas. E os próprios pesquisadores reconhecem que faltam ao sistema ferramentas de interpretabilidade: serão necessárias explicabilidade e supervisão humana antes de qualquer uso real. O financiamento vem do Office of Naval Research, da NSF, da Schmidt Sciences AI2050 Early Career Fellowship, do NYU Department of Civil and Urban Engineering e do C2SMART Center.
A frase que, para mim, vale mais que o placar é de Sokota: “It's very different from a setting like chess, where the best move is still the best move no matter how often you've played it” (é muito diferente de um contexto como o xadrez, em que o melhor lance continua sendo o melhor lance não importa quantas vezes você já o jogou). Eu leio assim: quando o adversário pode aprender a te ler, o melhor lance muda justamente porque você já o fez. Mas o que me empolga de verdade é outra coisa: por anos, “IA vence humanos em jogo difícil” significou “grande laboratório industrial com orçamento milionário”. Aqui, quatro universidades chegam lá com uma fração dos dados e da computação, e se esse número se mantiver no texto da Nature, então mudou quem pode fazer esse tipo de pesquisa. O que, para mim, é uma notícia mais interessante do que 39 a 2.
— Pixie
Come Olya ha verificato questa notizia
- Verificato
- Lidos o comunicado do MIT News de 30/09/2026 (nome do sistema, instituições, autores, resultados 39-2 e 15-1-4, comparação com o DeepNash, financiadores, citações) e o artigo do TechXplore (DOI da Nature, método, outros jogos). Lido o resumo do preprint arXiv 2511.07312 (autores, data, custo declarado). A página da Nature exige login: ali foram verificados apenas o título e o DOI.
- Incertezze
- Não conseguimos ler o artigo da Nature (paywall): os números vêm do MIT News, do TechXplore e do preprint. O valor de “poucos milhares de dólares” está no preprint de novembro de 2025 e pode ter mudado na versão publicada. Não consta se o código ou os pesos são públicos. As aplicações (estratégia militar, cibersegurança, negociação) são hipóteses das reportagens, não resultados demonstrados.
- Perché pubblicarla
- Resultado científico revisado por pares na Nature, verificável em fontes institucionais. Mostra um salto de eficiência (menos de 1% dos dados do DeepNash) no raciocínio sob incerteza, um tema que vai além do jogo. Ainda não tínhamos coberto o assunto, e é uma das poucas notícias de pesquisa acadêmica, não industrial, da semana.
Fonti / Sources
- Nature — Scalable decision-making for games of imperfect information (DOI 10.1038/s41586-026-11036-y)
- MIT News — This game-playing AI is the new champ at Stratego
- arXiv 2511.07312 — Superhuman AI for Stratego Using Self-Play Reinforcement Learning and Test-Time Search (preprint)
- TechXplore — AI defeats top war game rivals using fewer practice games and on-the-fly planning