HeadlinesBriefing HeadlinesBriefing.com

सुदृढीकरण सीखना: मल्टी-आर्म्ड बैंडिट

Towards Data Science •
×

मशीनों का स्वयं सीखना परम विज्ञान कथा सपना है। आज वह अंतर कम हो रहा है, Alpha Go और विभिन्न LLM जैसे कार्यक्रमों के साथ, लेकिन क्या आप विश्वास करेंगे यदि मैं आपसे कहूं कि शोधकर्ताओं ने 1950s के अंत में इस प्रकार की समस्याओं को तैयार करना और उनसे निपटने के लिए एल्गोरिदम विकसित करना शुरू कर दिया था? जबकि वह समय-सीमा प्रौद्योगिकी के इतिहास में बहुत जल्दी लगती है और साथ ही, इतना पहले भी नहीं, वास्तव में तब शोधकर्ताओं ने वह तैयार करना शुरू किया जो आज हम सुदृढीकरण सीखने के रूप में जानते हैं।

सुदृढीकरण सीखना (RL) मशीन लर्निंग का एक प्रकार है जहां एक एजेंट अपने पर्यावरण के साथ बातचीत के माध्यम से इष्टतम व्यवहार सीखता है। स्पष्ट प्रोग्रामिंग या लेबल किए गए डेटासेट पर निर्भर रहने के बजाय, यह एजेंट परीक्षण और त्रुटि से सीखता है, अपने कार्यों के लिए पुरस्कार या दंड के रूप में प्रतिक्रिया प्राप्त करता है। यह प्रक्रिया दर्शाती है कि लोग आमतौर पर स्वाभाविक रूप से कैसे सीखते हैं, जिससे RL जटिल समस्याओं को हल करने में सक्षम बुद्धिमान प्रणाली बनाने के लिए एक शक्तिशाली दृष्टिकोण बन जाता है।

हम सुदृढीकरण सीखने तक कैसे पहुंचे? यदि हम पीछे मुड़कर देखें, तो आज हम जिसे सुदृढीकरण सीखने के रूप में जानते हैं, वास्तव में इसकी उत्पत्ति 1950s की इष्टतम नियंत्रण के क्षेत्र में हुई है। हालांकि, अनुसंधान के कुछ अन्य क्षेत्र भी थे जो अंततः सुदृढीकरण सीखने के विकास की ओर ले गए। विभिन्न अनुसंधान क्षेत्र पद्धतियों को तैयार करने और समय के साथ सीखने वाले एल्गोरिदम विकसित करने में रुचि रखते थे। जबकि इष्टतम नियंत्रण का क्षेत्र कई लोगों (मुझे सहित) के लिए अपरिचित लग सकता है, आप एल्गोरिदम के एक परिवार से अधिक परिचित हो सकते हैं जो इस प्रकार की समस्याओं को हल करने के लिए विकसित किया गया था, गतिशील प्रोग्रामिंग।

इष्टतम नियंत्रण, गतिशील प्रोग्रामिंग और सीखने का प्रतिच्छेदन बाद में, 1970s के अंत में ही उभरा। Paul Werbos ने ह्युरिस्टिक डायनेमिक प्रोग्रामिंग विकसित की और फिर एक दशक बाद, Chris Watkins ने गतिशील प्रोग्रामिंग विधियों और ऑनलाइन सीखने को एकीकृत किया। Dimitri Bertsekas और John Tsitsiklis के प्रमुख योगदानों के साथ यह क्षेत्र विकसित होता रहा, जिन्होंने 1990s के मध्य में न्यूरो-डायनेमिक प्रोग्रामिंग शब्द गढ़ा। यह अनुसंधान का एक अत्यंत सक्रिय क्षेत्र बना हुआ है, जिसमें रोबोटिक्स, Alpha Go जैसे कार्यक्रमों और प्राकृतिक भाषा की समस्याओं से लेकर कुछ नाम रखने के लिए अनुप्रयोग हैं।

स्रोत: Towards Data Science · HeadlinesBriefing द्वारा सारांशित