Deep Blue derrotó a Garry Kasparov en ajedrez en 1997, Alpha Go venció a Lee Sedol en Go en 2016, y los bots de póquer han estado ganando a profesionales durante años. Pero un juego clásico llamado Stratego resistió. Incluso Deep Mind, con su excepcional presupuesto, no pudo construir una máquina que venciera de manera confiable a los mejores jugadores humanos. Ahora, un equipo de investigadores de Carnegie Mellon, MIT, New York University y Stanford University lo ha logrado.
Su IA, llamada Ataraxos, derrotó a Pim Niemeijer, posiblemente el mejor jugador de Stratego de todos los tiempos, 15 juegos a uno, con cuatro empates. Y solo tomó 16 GPU y unos pocos miles de dólares entrenarla. En Stratego, cada jugador obtiene 40 piezas que representan rangos militares, desde un mariscal hasta un espía, además de bombas y una bandera. Ganas capturando la bandera del oponente. Tu oponente sabe dónde están tus piezas, pero no qué son.
Las identidades se revelan solo cuando dos piezas chocan en batalla: la más débil se elimina y se revela la identidad del ganador. Eso hace de Stratego un juego de información imperfecta, como el póquer, que las computadoras descifraron hace años. “Hay algo súper distintivo sobre Stratego, que es una cantidad masiva de información oculta que se desarrolla en una escala de tiempo muy larga”, dijo Eugene Vinitsky, investigador de NYU y coautor del estudio.
En algunas formas de póquer, la información oculta es mínima. En Texas Hold'em, “Solo tienes dos cartas ocultas”, dijo Gabriele Farina, científico informático de MIT y otro coautor. Eso deja solo 1,326 manos posibles, lo suficientemente pocas para que una máquina las evalúe todas. “En Stratego, hay 40 piezas en el tablero que podrían estar en cualquier orden”, dijo Farina. Eso es más de un decillón de configuraciones posibles. Luego está la duración del juego. “En ajedrez, generalmente el juego dura 40 movimientos, pero en Stratego, un juego puede durar fácilmente 2,000 movimientos”, dijo Farina. Además, Stratego es un juego de faroles. A veces mueves una pieza débil como si fuera un mariscal, solo para asustar al oponente. Cuando los jugadores farolean demasiado, sus amenazas no significan nada; cuando nunca farolean, se vuelven predecibles. Ese acto de equilibrio, explica el equipo, es lo que dejó perplejas a IAs anteriores como Deep Nash de Deep Mind, introducido en 2022.
Fuente: Ars Technica · Resumido por HeadlinesBriefing