Deep Blue mengalahkan Garry Kasparov di catur pada 1997, Alpha Go mengalahkan Lee Sedol di Go pada 2016, dan bot poker telah mengalahkan profesional selama bertahun-tahun. Tapi satu game klasik bernama Stratego bertahan. Bahkan Deep Mind, dengan anggaran luar biasanya, tidak bisa membangun mesin yang secara andal mengalahkan pemain manusia terbaik. Sekarang, tim peneliti dari Carnegie Mellon, MIT, New York University, dan Stanford University telah berhasil.
AI mereka, bernama Ataraxos, mengalahkan Pim Niemeijer, bisa dibilang pemain Stratego terbaik sepanjang masa, 15 game berbanding satu, dengan empat hasil imbang. Dan hanya butuh 16 GPU dan beberapa ribu dolar untuk melatihnya. Dalam Stratego, setiap pemain mendapat 40 buah yang mewakili pangkat militer, dari marshal hingga mata-mata, plus bom dan bendera. Anda menang dengan menangkap bendera lawan. Lawan Anda tahu di mana buah Anda berada, tapi tidak tahu apa buah itu.
Identitas hanya terungkap ketika dua buah bertabrakan dalam pertempuran—buah yang lebih lemah dihilangkan, dan identitas pemenang terungkap. Itu membuat Stratego menjadi game informasi tidak sempurna, seperti poker, yang sudah dipecahkan komputer bertahun-tahun lalu. “Ada sesuatu yang sangat khas tentang Stratego, yaitu sejumlah besar informasi tersembunyi yang terungkap dalam skala waktu yang sangat panjang,” kata Eugene Vinitsky, peneliti di NYU dan rekan penulis studi.
Dalam beberapa bentuk poker, informasi tersembunyi sangat kecil. Dalam Texas Hold'em, “Anda hanya memiliki dua kartu tersembunyi,” kata Gabriele Farina, ilmuwan komputer MIT dan rekan penulis lainnya. Itu menyisakan hanya 1.326 kemungkinan tangan, cukup sedikit untuk mesin mempertimbangkan semuanya. “Dalam Stratego, ada 40 buah di papan yang bisa dalam urutan apa pun,” kata Farina. Itu lebih dari satu desilion kemungkinan pengaturan. Lalu ada panjangnya game. “Dalam catur, biasanya game berlangsung 40 langkah, tapi dalam Stratego, sebuah game bisa dengan mudah berlangsung 2.000 langkah,” kata Farina. Di atas itu, Stratego adalah game menggertak. Terkadang Anda menggerakkan buah lemah seolah-olah itu marshal, hanya untuk menakuti lawan. Saat pemain terlalu sering menggertak, ancaman mereka tidak berarti; saat mereka tidak pernah menggertak, mereka menjadi bisa diprediksi. Tindakan penyeimbangan itu, jelas tim, adalah apa yang membuat AI sebelumnya seperti Deep Nash milik Deep Mind, yang diperkenalkan pada 2022, bingung.
Sumber: Ars Technica · Diringkas oleh HeadlinesBriefing