Deep Blue besiegte 1997 Garry Kasparov im Schach, Alpha Go besiegte 2016 Lee Sedol im Go, und Poker-Bots schlagen seit Jahren Profis. Aber ein klassisches Spiel namens Stratego hielt stand. Selbst Deep Mind konnte mit seinem außergewöhnlichen Budget keine Maschine bauen, die zuverlässig die besten menschlichen Spieler besiegte. Jetzt hat ein Team von Forschern von Carnegie Mellon, MIT, New York University und Stanford University es geschafft.
Ihre KI, genannt Ataraxos, besiegte Pim Niemeijer, wohl den besten Stratego-Spieler aller Zeiten, mit 15 Spielen zu einem, bei vier Unentschieden. Und es dauerte nur 16 GPUs und ein paar tausend Dollar, um sie zu trainieren. Bei Stratego erhält jeder Spieler 40 Figuren, die militärische Ränge repräsentieren, von einem Marschall bis zu einem Spion, plus Bomben und eine Flagge. Sie gewinnen, indem Sie die Flagge des Gegners erobern. Ihr Gegner weiß, wo Ihre Figuren sind, aber nicht, was sie sind.
Identitäten werden nur enthüllt, wenn zwei Figuren im Kampf kollidieren – die schwächere wird entfernt und die Identität des Gewinners wird enthüllt. Das macht Stratego zu einem Spiel mit unvollständiger Information, genau wie Poker, das Computer vor Jahren geknackt haben. „Es gibt etwas ganz Besonderes an Stratego, nämlich dass es eine massive Menge versteckter Informationen ist, die sich über einen sehr langen Zeitraum entfaltet“, sagte Eugene Vinitsky, Forscher an der NYU und Co-Autor der Studie.
Bei einigen Pokerformen sind die versteckten Informationen winzig. Bei Texas Hold'em „hat man nur zwei versteckte Karten“, sagte Gabriele Farina, Informatiker am MIT und ein weiterer Co-Autor. Das lässt nur 1.326 mögliche Hände übrig, wenige genug, um sie alle von einer Maschine abzuwägen. „Bei Stratego gibt es 40 Figuren auf dem Brett, die in beliebiger Reihenfolge sein können“, sagte Farina. Das sind mehr als eine Dezillion mögliche Aufstellungen. Dann ist da noch die Länge des Spiels. „Beim Schach dauert das Spiel normalerweise 40 Züge, aber bei Stratego kann ein Spiel leicht 2.000 Züge dauern“, sagte Farina. Hinzu kommt, dass Stratego ein Spiel des Bluffens ist. Manchmal bewegt man eine schwache Figur, als wäre sie ein Marschall, nur um den Gegner zu verängstigen. Wenn Spieler zu oft bluffen, bedeuten ihre Drohungen nichts; wenn sie nie bluffen, werden sie vorhersehbar. Dieser Balanceakt, erklärt das Team, ist es, was frühere KIs wie Deep Minds Deep Nash, eingeführt im Jahr 2022, verblüffte.
Quelle: Ars Technica · Zusammengefasst von HeadlinesBriefing