Deep Blue هزم Garry Kasparov في الشطرنج عام 1997، وAlpha Go هزم Lee Sedol في Go عام 2016، وروبوتات البوكر تهزم المحترفين منذ سنوات. لكن لعبة كلاسيكية تسمى Stratego صمدت. حتى Deep Mind، بميزانيته الاستثنائية، لم يستطع بناء آلة تهزم أفضل اللاعبين البشر بشكل موثوق. الآن، فريق من الباحثين من Carnegie Mellon وMIT وNew York University وStanford University فعلها.
الذكاء الاصطناعي الخاص بهم، المسمى Ataraxos، هزم Pim Niemeijer، الذي يمكن القول إنه أفضل لاعب Stratego على الإطلاق، 15 مباراة مقابل واحدة، مع أربعة تعادلات. واستغرق تدريبه 16 GPU فقط وبضعة آلاف من الدولارات. في Stratego، يحصل كل لاعب على 40 قطعة تمثل الرتب العسكرية، من مارشال إلى جاسوس، بالإضافة إلى قنابل وعلم. تربح بالاستيلاء على علم الخصم. خصمك يعرف أين قطعك، لكن لا يعرف ما هي.
يتم الكشف عن الهويات فقط عندما تصطدم قطعتان في المعركة—تتم إزالة الأضعف، ويتم الكشف عن هوية الفائز. هذا يجعل Stratego لعبة معلومات غير كاملة، تمامًا مثل البوكر، التي اخترقتها أجهزة الكمبيوتر منذ سنوات. "هناك شيء مميز للغاية في Stratego، وهو أنها كمية هائلة من المعلومات المخفية التي تتكشف على مقياس زمني طويل جدًا،" قال Eugene Vinitsky، باحث في NYU ومؤلف مشارك في الدراسة.
في بعض أشكال البوكر، تكون المعلومات المخفية ضئيلة. في Texas Hold'em، "لديك بطاقتان مخفيتان فقط،" قال Gabriele Farina، عالم كمبيوتر في MIT ومؤلف مشارك آخر. هذا يترك فقط 1,326 يدًا محتملة، قليلة بما يكفي لآلة لوزنها جميعًا. "في Stratego، هناك 40 قطعة على اللوحة يمكن أن تكون بأي ترتيب،" قال Farina. هذا أكثر من ديسيليون من الإعدادات المحتملة. ثم هناك طول اللعبة. "في الشطرنج، عادة ما تستمر اللعبة 40 نقلة، لكن في Stratego، يمكن أن تستمر اللعبة بسهولة 2,000 نقلة،" قال Farina. علاوة على ذلك، Stratego هي لعبة خداع. أحيانًا تحرك قطعة ضعيفة كما لو كانت مارشال، فقط لتخويف الخصم. عندما يخدع اللاعبون كثيرًا، لا تعني تهديداتهم شيئًا؛ عندما لا يخدعون أبدًا، يصبحون متوقعين. هذا الفعل التوازني، يشرح الفريق، هو ما أربك الذكاء الاصطناعي السابق مثل Deep Nash من Deep Mind، الذي تم تقديمه في 2022.
المصدر: Ars Technica · لخّصه HeadlinesBriefing