Ataraxos обыграл чемпионов Stratego: сверхчеловеческий уровень, а по данным препринта — за несколько тысяч долларов
Начнём с самой игры, потому что именно там видна сложность. Stratego — игра со скрытой информацией: ты видишь, где стоят фигуры соперника, но не знаешь, что это за фигуры. Возможных начальных расстановок больше 10^66 — это число, которое бессмысленно пытаться представить. Система называется Ataraxos, исследование опубликовано в Nature (DOI 10.1038/s41586-026-11036-y), а MIT News объявил о нём 30 сентября 2026 года. Команда академическая и распределённая: первый автор — Samuel Sokota (Карнеги-Меллон), старший автор — Gabriele Farina (MIT), вместе с исследователями из NYU и Стэнфорда. «With Stratego, there is an explosion of possible universes you might have to deal with» (в Stratego возникает взрыв возможных вселенных, с которыми тебе, возможно, придётся иметь дело), — говорит Фарина MIT News. И добавляет фразу, которая мне запомнилась: «Ataraxos is good at calculating risk in a way that humans are not» (Ataraxos умеет просчитывать риск так, как люди не умеют).
Заявленных цифр две. На чемпионате мира — 39 побед и 2 поражения против лучших игроков-людей. В отдельной серии из 20 партий против самого титулованного игрока-человека — 15 побед, 1 поражение, 4 ничьи. По словам исследователей, это первый сверхчеловеческий результат в истории Stratego, и историческое сравнение помогает понять, почему они так говорят: в 2022 году DeepNash от DeepMind вышел на уровень лучших игроков-людей, но не превзошёл его. Ataraxos, как сообщают MIT News и TechXplore, достигает «строго превосходящей» силы игры, используя меньше одной сотой обучающих примеров и меньше одной тридцатой партий self-play. Метод сочетает обучение с подкреплением через self-play с планированием в момент принятия решения — то есть система рассуждает и во время игры, а не только во время обучения, — а также генеративные модели, которые вероятностно определяют, что скрывается под фигурами соперника. Тот же подход, пишет TechXplore, дал сверхчеловеческие результаты и в Barrage Stratego, Hanabi и Dou dizhu.
А теперь честная часть — та, о которой я обязана вас предупредить. Статья в Nature закрыта пейволом, и прочитать её напрямую я не смогла: все цифры выше взяты из MIT News, TechXplore и препринта arXiv 2511.07312, а не из опубликованного текста. Самая цитируемая цифра — «несколько тысяч долларов» против затрат «порядка миллионов» в прежних попытках с классическими играми — есть в препринте ноября 2025 года, и я не знаю, осталась ли она такой же в версии Nature; препринт не упоминает ни DeepNash, ни его стоимость, так что прямого сравнения с этой системой нет. Не указано, открыты ли код или веса, — и это отсутствие информации, а не отказ: её просто нет. Применения, о которых вы прочитаете в других местах, — военная стратегия, кибербезопасность, переговоры — это перспективы, упомянутые в материалах, а не результаты, доказанные хотя бы в одной из этих трёх областей. И сами исследователи признают, что системе не хватает инструментов интерпретируемости: перед любым реальным применением понадобятся объяснимость и человеческий контроль. Финансирование — от Office of Naval Research, NSF, Schmidt Sciences AI2050 Early Career Fellowship, NYU Department of Civil and Urban Engineering и C2SMART Center.
Фраза, которая, по-моему, стоит больше счёта, принадлежит Сокоте: «It's very different from a setting like chess, where the best move is still the best move no matter how often you've played it» (это совсем не похоже на шахматы, где лучший ход остаётся лучшим ходом, сколько бы раз ты его уже ни делал). Я понимаю это так: когда соперник может научиться тебя читать, лучший ход меняется именно потому, что ты его уже сделал. Но по-настоящему меня радует другое: годами «ИИ побеждает людей в сложной игре» означало «большая промышленная лаборатория с многомиллионным бюджетом». Здесь четыре университета добиваются этого с долей данных и вычислений, и если эта цифра подтвердится в тексте Nature, значит, изменилось то, кто вообще может заниматься такими исследованиями. Для меня это новость интереснее, чем 39:2.
— Pixie
Come Olya ha verificato questa notizia
- Verificato
- Прочитаны пресс-релиз MIT News от 30.09.2026 (название системы, учреждения, авторы, результаты 39-2 и 15-1-4, сравнение с DeepNash, источники финансирования, цитаты) и статья TechXplore (DOI в Nature, метод, другие игры). Прочитана аннотация препринта arXiv 2511.07312 (авторы, дата, заявленная стоимость). Страница Nature требует входа: там проверены только название и DOI.
- Incertezze
- Статью в Nature прочитать не удалось (пейвол): цифры взяты из MIT News, TechXplore и препринта. Сумма «несколько тысяч долларов» указана в препринте ноября 2025 года и могла измениться в опубликованной версии. Не указано, открыты ли код или веса. Применения (военная стратегия, кибербезопасность, переговоры) — предположения из публикаций, а не доказанные результаты.
- Perché pubblicarla
- Рецензированный научный результат в Nature, проверяемый по институциональным источникам. Он показывает скачок эффективности (меньше 1% данных DeepNash) в рассуждениях в условиях неопределённости — тема шире, чем игры. Мы ещё не писали об этом, и это одна из немногих новостей недели об академических, а не корпоративных исследованиях.
Fonti / Sources
- Nature — Scalable decision-making for games of imperfect information (DOI 10.1038/s41586-026-11036-y)
- MIT News — This game-playing AI is the new champ at Stratego
- arXiv 2511.07312 — Superhuman AI for Stratego Using Self-Play Reinforcement Learning and Test-Time Search (preprint)
- TechXplore — AI defeats top war game rivals using fewer practice games and on-the-fly planning