HeadlinesBriefing HeadlinesBriefing.com

AIがStrategoを破る:Ataraxos勝利

Ars Technica •
×

Deep Blueは1997年にチェスでGarry Kasparovを破り、Alpha Goは2016年に囲碁でLee Sedolを破り、ポーカーボットは何年もプロを打ち負かしてきた。しかし、Strategoという古典的なゲームは持ちこたえた。Deep Mindでさえ、その例外的な予算をもってしても、最高の人間プレイヤーを確実に打ち負かすマシンを構築できなかった。今、Carnegie Mellon、MIT、New York University、Stanford Universityの研究者チームがそれを成し遂げた。

彼らのAI、Ataraxosと呼ばれるものは、おそらく史上最高のStrategoプレイヤーであるPim Niemeijerを、15勝1敗、4引き分けで破った。そして、それを訓練するのにたった16のGPUと数千ドルしかかからなかった。Strategoでは、各プレイヤーは軍の階級を表す40個の駒を取得する。元帥からスパイまで、さらに爆弾と旗がある。相手の旗を捕獲することで勝利する。相手はあなたの駒がどこにあるかは知っているが、それが何であるかは知らない。

正体は、2つの駒が戦闘で衝突したときにのみ明らかになる。弱い方が取り除かれ、勝者の正体が明らかになる。これにより、Strategoは不完全情報ゲームとなり、コンピューターが何年も前に解読したポーカーとまったく同じになる。「Strategoには非常に特徴的な点があり、それは非常に長い時間スケールで展開される膨大な量の隠された情報です」と、NYUの研究者で研究の共著者であるEugene Vinitskyは述べた。

ポーカーのいくつかの形式では、隠された情報はごくわずかです。Texas Hold'emでは、「隠されたカードは2枚だけです」と、MITのコンピューター科学者で別の共著者であるGabriele Farinaは述べた。これにより、可能な手はわずか1,326通りとなり、機械がそれらすべてを評価するのに十分な少なさです。「Strategoでは、ボード上に40個の駒があり、任意の順序で配置される可能性があります」とFarinaは述べた。これは1デシリオンを超える可能な配置です。次に、ゲームの長さがあります。「チェスでは、通常ゲームは40手で終わりますが、Strategoでは、ゲームは簡単に2,000手続くことがあります」とFarinaは述べた。その上、Strategoはブラフのゲームです。時には、弱い駒をまるで元帥であるかのように動かし、単に相手を怖がらせることがあります。プレイヤーがブラフをしすぎると、その脅威は意味をなさなくなり、まったくブラフをしないと、予測可能になります。チームは、このバランスを取る行為こそが、2022年に導入されたDeep MindのDeep Nashのような初期のAIを悩ませたものだと説明している。

出典: Ars Technica · 要約:HeadlinesBriefing