Deep Blue在1997年击败了Garry Kasparov,Alpha Go在2016年击败了Lee Sedol,扑克机器人多年来一直击败专业人士。但一款经典游戏Stratego一直坚守。即使是拥有非凡预算的Deep Mind,也无法制造出一台能够可靠击败最佳人类玩家的机器。现在,来自Carnegie Mellon、MIT、New York University和Stanford University的研究团队做到了。
他们的人工智能Ataraxos击败了Pim Niemeijer,他可以说是史上最优秀的Stratego玩家,战绩为15胜1负,4平。而且训练它只用了16个GPU和几千美元。在Stratego中,每位玩家有40个棋子,代表从元帅到间谍的军衔,还有炸弹和一面旗帜。你通过夺取对手的旗帜获胜。你的对手知道你的棋子在哪里,但不知道它们是什么。
只有当两个棋子在对战中碰撞时,身份才会被揭示——较弱的棋子被移除,获胜者的身份被揭示。这使得Stratego成为一个不完全信息游戏,就像扑克一样,而计算机多年前就已经破解了扑克。“Stratego有一个非常独特的特点,那就是它拥有大量隐藏信息,并且这些信息在很长的时间尺度上展开,”NYU研究员、该研究的合著者Eugene Vinitsky说。
在某些扑克形式中,隐藏信息很少。在Texas Hold'em中,“你只有两张隐藏的牌,”MIT计算机科学家、另一位合著者Gabriele Farina说。这只剩下1,326种可能的牌型,少到机器可以全部权衡。“在Stratego中,棋盘上有40个棋子,可以以任何顺序排列,”Farina说。这超过了一百万亿亿亿种可能的布局。然后是游戏的长度。“在国际象棋中,游戏通常持续40步,但在Stratego中,一局游戏很容易达到2,000步,”Farina说。除此之外,Stratego是一个虚张声势的游戏。有时你移动一个弱小的棋子,假装它是元帅,只是为了吓跑对手。当玩家虚张声势太频繁时,他们的威胁毫无意义;当他们从不虚张声势时,他们变得可预测。团队解释说,这种平衡行为正是让早期AI(如Deep Mind在2022年推出的Deep Nash)难以攻克的原因。
来源: Ars Technica · 由HeadlinesBriefing整理摘要