HeadlinesBriefing HeadlinesBriefing.com

AI ने Stratego को हराया: Ataraxos जीता

Ars Technica •
×

Deep Blue ने 1997 में शतरंज में Garry Kasparov को हराया, Alpha Go ने 2016 में Go में Lee Sedol को हराया, और पोकर बॉट वर्षों से पेशेवरों को हरा रहे हैं। लेकिन Stratego नामक एक क्लासिक गेम ने डटकर मुकाबला किया। यहां तक कि Deep Mind, अपने असाधारण बजट के साथ, एक ऐसी मशीन नहीं बना सका जो सर्वश्रेष्ठ मानव खिलाड़ियों को विश्वसनीय रूप से हरा सके। अब, Carnegie Mellon, MIT, New York University और Stanford University के शोधकर्ताओं की एक टीम ने यह कर दिखाया है।

उनकी AI, जिसे Ataraxos कहा जाता है, ने Pim Niemeijer को हराया, जो अब तक का सबसे अच्छा Stratego खिलाड़ी माना जाता है, 15 गेम से एक, चार ड्रॉ के साथ। और इसे प्रशिक्षित करने में केवल 16 GPU और कुछ हज़ार डॉलर लगे। Stratego में, प्रत्येक खिलाड़ी को 40 टुकड़े मिलते हैं जो सैन्य रैंकों का प्रतिनिधित्व करते हैं, एक मार्शल से लेकर एक जासूस तक, साथ ही बम और एक झंडा। आप प्रतिद्वंद्वी के झंडे पर कब्जा करके जीतते हैं। आपका प्रतिद्वंद्वी जानता है कि आपके टुकड़े कहाँ हैं, लेकिन नहीं जानता कि वे क्या हैं।

पहचान केवल तब प्रकट होती है जब दो टुकड़े युद्ध में टकराते हैं—कमजोर टुकड़ा हटा दिया जाता है, और विजेता की पहचान प्रकट होती है। यह Stratego को एक अपूर्ण-सूचना वाला गेम बनाता है, बिल्कुल पोकर की तरह, जिसे कंप्यूटरों ने वर्षों पहले क्रैक कर लिया था। “Stratego के बारे में कुछ बहुत ही विशिष्ट है, जो यह है कि यह छिपी हुई जानकारी की एक विशाल मात्रा है जो बहुत लंबी समयावधि में सामने आती है,” NYU के शोधकर्ता और अध्ययन के सह-लेखक Eugene Vinitsky ने कहा।

पोकर के कुछ रूपों में, छिपी हुई जानकारी बहुत कम होती है। Texas Hold'em में, “आपके पास केवल दो छिपे हुए कार्ड होते हैं,” MIT के कंप्यूटर वैज्ञानिक और एक अन्य सह-लेखक Gabriele Farina ने कहा। यह केवल 1,326 संभावित हाथ छोड़ता है, इतने कम कि एक मशीन उन सभी का वजन कर सके। “Stratego में, बोर्ड पर 40 टुकड़े होते हैं जो किसी भी क्रम में हो सकते हैं,” Farina ने कहा। यह एक डेसिलियन से अधिक संभावित सेटअप है। फिर खेल की लंबाई है। “शतरंज में, आमतौर पर खेल 40 चालों तक चलता है, लेकिन Stratego में, एक खेल आसानी से 2,000 चालों तक चल सकता है,” Farina ने कहा। इसके अलावा, Stratego ब्लफिंग का खेल है। कभी-कभी आप एक कमजोर टुकड़े को ऐसे चलाते हैं जैसे वह मार्शल हो, सिर्फ प्रतिद्वंद्वी को डराने के लिए। जब खिलाड़ी बहुत बार ब्लफ करते हैं, तो उनकी धमकियों का कोई मतलब नहीं रहता; जब वे कभी ब्लफ नहीं करते, तो वे पूर्वानुमानित हो जाते हैं। टीम बताती है कि यह संतुलन क्रिया ही वह चीज है जिसने Deep Mind के Deep Nash जैसी पिछली AI को हैरान कर दिया था, जिसे 2022 में पेश किया गया था।

स्रोत: Ars Technica · HeadlinesBriefing द्वारा सारांशित