Deep Blue derrotou Garry Kasparov no xadrez em 1997, Alpha Go venceu Lee Sedol no Go em 2016, e bots de pôquer têm vencido profissionais por anos. Mas um jogo clássico chamado Stratego resistiu. Até mesmo a Deep Mind, com seu orçamento excepcional, não conseguiu construir uma máquina que derrotasse de forma confiável os melhores jogadores humanos. Agora, uma equipe de pesquisadores da Carnegie Mellon, MIT, New York University e Stanford University conseguiu.
Sua IA, chamada Ataraxos, derrotou Pim Niemeijer, indiscutivelmente o melhor jogador de Stratego de todos os tempos, 15 jogos a um, com quatro empates. E levou apenas 16 GPUs e alguns milhares de dólares para treiná-la. No Stratego, cada jogador recebe 40 peças representando patentes militares, de um marechal a um espião, além de bombas e uma bandeira. Você vence capturando a bandeira do oponente. Seu oponente sabe onde suas peças estão, mas não o que são.
As identidades são reveladas apenas quando duas peças colidem em batalha—a mais fraca é removida, e a identidade do vencedor é revelada. Isso torna Stratego um jogo de informação imperfeita, assim como o pôquer, que os computadores decifraram anos atrás. “Há algo super distintivo sobre Stratego, que é uma quantidade massiva de informação oculta que se desenrola em uma escala de tempo muito longa,” disse Eugene Vinitsky, pesquisador da NYU e coautor do estudo.
Em algumas formas de pôquer, a informação oculta é mínima. No Texas Hold'em, “Você tem apenas duas cartas ocultas,” disse Gabriele Farina, cientista da computação do MIT e outro coautor. Isso deixa apenas 1.326 mãos possíveis, poucas o suficiente para uma máquina pesá-las todas. “No Stratego, há 40 peças no tabuleiro que podem estar em qualquer ordem,” disse Farina. Isso é mais de um decilhão de configurações possíveis. Depois, há a duração do jogo. “No xadrez, geralmente o jogo dura 40 movimentos, mas no Stratego, um jogo pode facilmente durar 2.000 movimentos,” disse Farina. Além disso, Stratego é um jogo de blefe. Às vezes você move uma peça fraca como se fosse um marechal, apenas para assustar o oponente. Quando os jogadores blefam com muita frequência, suas ameaças não significam nada; quando nunca blefam, tornam-se previsíveis. Esse ato de equilíbrio, explica a equipe, é o que deixou perplexas IAs anteriores como o Deep Nash da Deep Mind, introduzido em 2022.
Fonte: Ars Technica · Resumido por HeadlinesBriefing