Deep Blue победил Garry Kasparov в шахматах в 1997 году, Alpha Go победил Lee Sedol в Go в 2016 году, и покерные боты годами обыгрывают профессионалов. Но одна классическая игра под названием Stratego устояла. Даже Deep Mind, с его исключительным бюджетом, не смог создать машину, которая надежно побеждала бы лучших игроков-людей. Теперь команда исследователей из Carnegie Mellon, MIT, New York University и Stanford University сделала это.
Их ИИ, названный Ataraxos, победил Pim Niemeijer, возможно, лучшего игрока в Stratego всех времен, со счетом 15 игр против одной, при четырех ничьих. И для его обучения потребовалось всего 16 GPU и несколько тысяч долларов. В Stratego каждый игрок получает 40 фигур, представляющих воинские звания, от маршала до шпиона, плюс бомбы и флаг. Вы выигрываете, захватив флаг противника. Ваш противник знает, где находятся ваши фигуры, но не знает, что они собой представляют.
Личности раскрываются только тогда, когда две фигуры сталкиваются в бою — более слабая удаляется, и личность победителя раскрывается. Это делает Stratego игрой с несовершенной информацией, как и покер, который компьютеры взломали годы назад. «В Stratego есть нечто очень отличительное, а именно огромное количество скрытой информации, которая разворачивается в течение очень длительного периода времени», — сказал Eugene Vinitsky, исследователь из NYU и соавтор исследования.
В некоторых формах покера скрытая информация незначительна. В Texas Hold'em «у вас есть только две скрытые карты», — сказал Gabriele Farina, компьютерный ученый из MIT и еще один соавтор. Это оставляет всего 1 326 возможных комбинаций, достаточно мало, чтобы машина могла взвесить их все. «В Stratego на доске 40 фигур, которые могут быть в любом порядке», — сказал Farina. Это более дециллиона возможных расстановок. Затем есть продолжительность игры. «В шахматах игра обычно длится 40 ходов, но в Stratego игра может легко длиться 2 000 ходов», — сказал Farina. Вдобавок ко всему, Stratego — это игра блефа. Иногда вы двигаете слабую фигуру так, как если бы это был маршал, просто чтобы напугать противника. Когда игроки блефуют слишком часто, их угрозы ничего не значат; когда они никогда не блефуют, они становятся предсказуемыми. Этот балансирующий акт, объясняет команда, и поставил в тупик более ранние ИИ, такие как Deep Nash от Deep Mind, представленный в 2022 году.
Источник: Ars Technica · Сводку подготовил HeadlinesBriefing