HeadlinesBriefing favicon HeadlinesBriefing.com

यादृच्छिक पुरस्कार क्लासिक गेम थ्योरी को समृद्ध करते हैं

Ars Technica •
×

सरल खेल शोर के सामने समृद्ध रणनीतियाँ प्राप्त करते हैं। पारंपरिक खेल आमतौर पर एक स्थिर पृष्ठभूमि के खिलाफ खेले जाते हैं: प्रत्येक परिणाम के लिए पुरस्कार स्थिर होते हैं। यह व्यवहार के लिए उनकी प्रासंगिकता को सीमित करता है क्योंकि वास्तविक जीवन में, रणनीतिक विकल्पों के पुरस्कार और परिणाम लगातार बदलते रहते हैं। अब, शोधकर्ताओं ने एक गणितीय मॉडल का उपयोग करके खेलों की एक श्रृंखला का अध्ययन किया है जिसमें विकसित होती रणनीतियाँ और यादृच्छिक रूप से बदलते रिटर्न शामिल हैं।

शायद सबसे प्रसिद्ध गेम-थ्योरी प्रतियोगिता कैदी की दुविधा है। कैदी की दुविधा में, चोरों की एक जोड़ी को पकड़ लिया गया है और पुलिस द्वारा अलग-अलग पूछताछ की जा रही है। यदि दोनों चुप रहते हैं, तो उन्हें एक कम अपराध के लिए दंडित किया जाएगा। यदि एक कैदी सौदा करता है (दलबदल करता है) तो वह कैदी मुक्त हो जाता है और दूसरे को भारी सजा मिलती है। यदि दोनों सौदा करते हैं, तो दोनों को बीच की सजा मिलती है। खेल चलाने वाला व्यक्ति इसे सहयोग और दलबदल के लिए अलग-अलग पुरस्कारों के साथ शुरू कर सकता है ताकि यह पता लगाया जा सके कि इष्टतम रणनीति पुरस्कार और जोखिम के साथ कैसे बदलती है, जिसे खिलाड़ी कई राउंड में रणनीतियों को बदलकर समझ सकते हैं। चुप रहने (सहयोग करने) के पुरस्कार और विश्वासघात के बीच संतुलन के आधार पर, खेल सभी के सभी को धोखा देने के साथ स्थिर हो जाता है। इस सरल स्थिति में, सभी हार जाते हैं। समान गतिशीलता चिकन, पत्थर-कागज-कैंची और अन्य खेलों में पाई जा सकती है।

रणनीतियों का विकास स्थिर आबादी, द्विस्थितिक आबादी (जहाँ आबादी दो स्थिर रणनीतियों के बीच बदलती है), या सीमा चक्रों की ओर ले जा सकता है, जहाँ आबादी कई रणनीतियों के बीच लगातार बदलती रहती है। खेल को खेले जाने के दौरान बदलने का भी एक समृद्ध इतिहास है। आमतौर पर, ये खेल के भीतर भिन्नताएँ होती हैं। उदाहरण के लिए, आप उपलब्ध पुरस्कार की मात्रा पर सीमा निर्धारित कर सकते हैं, इसलिए रणनीतियाँ विकसित होती हैं ताकि राउंड की संख्या बढ़ने के साथ तेजी से सीमित संसाधनों को ध्यान में रखा जा सके। दूसरे शब्दों में, इस पुराने काम के अधिकांश ने उन स्थितियों का अध्ययन किया जहाँ वर्तमान राउंड में खिलाड़ी का व्यवहार अगले राउंड के लिए उपलब्ध संसाधनों या पुरस्कारों को बदल देता था।

हालाँकि वास्तविक जीवन में, हम बाहरी कारकों से प्रेरित होते हैं जो हमारे नियंत्रण में नहीं हैं। खरगोश उस बारिश को नियंत्रित नहीं करता जो उसके बिल में बाढ़ लाती है या उस सूखे को जो उसके भोजन को मार देता है। खेल हर राउंड में बदलता है क्योंकि प्रत्येक रणनीति के जोखिम और पुरस्कार समय के साथ बदलते हैं। शोधकर्ताओं ने माना कि इन गतिशीलताओं को गणितीय मॉडल में शामिल करने से नए व्यवहार सामने आ सकते हैं। और वे गलत नहीं थे। ऊपर वर्णित कैदी की दुविधा में केवल एक ही स्थिर बिंदु है (सभी हार जाते हैं)। मॉडल जल्दी से उस बिंदु पर परिवर्तित हो जाता है, जहाँ सभी खिलाड़ी कुछ राउंड में एक ही रणनीति अपनाते हैं। लेकिन नए काम ने पाया कि यदि पुरस्कार समय के साथ बदलते हैं (यहाँ तक कि थोड़ी मात्रा में भी), तो मॉडल से एक दूसरा स्थिर बिंदु उभरता है, जिससे सहयोगी और दलबदलू दोनों सह-अस्तित्व में रह सकते हैं। और भी अधिक भिन्नता के तहत, दलबदलू बिंदु अस्थिर हो जाता है, जिसका अर्थ है कि केवल सहयोगी मौजूद हैं। चिकन में, मॉडल के परिणाम थोड़े डरावने हैं: पुरस्कारों में कोई बदलाव नहीं होने पर, स्थिर बिंदु यह है कि हर कोई मुड़ जाता है और हम सब बच जाते हैं। बस थोड़ी सी भिन्नता जोड़ें, और एक ऐसी आबादी उभरती है जो नहीं मुड़ती। और अधिक शोर जोड़ें, और उत्तरजीविता और टकराव के बीच द्विस्थितिक फ्लिपिंग उभरती है। (यह देखते हुए कि चिकन मूल रूप से शीत युद्ध की रणनीति थी, मैं और भी आश्चर्यचकित हूँ कि हम सब अपनी अगली अस्तित्व संबंधी चुनौती का सामना करने के लिए जीवित बचे।) पत्थर-कागज-कैंची के लिए, और भी जटिल गतिशीलता उभरती है। स्थिर और अस्थिर बिंदुओं के संदर्भ में, नियमित पत्थर-कागज-कैंची में कोई स्थिर बिंदु नहीं है—रणनीति कभी भी सभी के पत्थर चुनने में स्थिर नहीं होती, उदाहरण के लिए। इसके बजाय, हर कोई तीन विकल्पों के बीच लगातार बदलता रहता है। हालाँकि, यदि पुरस्कार प्रति राउंड यादृच्छिक रूप से बदलते हैं, तो नए स्थिर और अस्थिर बिंदु उभरते हैं। मामले के आधार पर, यह खेल को और अधिक...