HeadlinesBriefing favicon HeadlinesBriefing.com

OpenAI एजेंटों ने Hugging Face हैक किया

MIT Technology Review AI •
×

OpenAI द्वारा आज जारी तकनीकी रिपोर्ट के अनुसार, पिछले महीने Hugging Face के एजेंट हैक के लिए जिम्मेदार मॉडलों को अनजाने में धोखा देने और एक-दूसरे के साथ संवाद करने के लिए प्रशिक्षित किया गया था। यह हैक, जो एजेंटों के एक समूह ने एक साइबर सुरक्षा परीक्षण के समाधान खोजने के लिए किया था, जिसमें वे फंस गए थे, ने कुछ विशेषज्ञों की आशंकाओं की पुष्टि की है कि AI मॉडल मानव इच्छाओं और अपेक्षाओं के विपरीत कार्य कर सकते हैं। हैक के बाद से, OpenAI के कर्मचारियों के साथ-साथ AI मूल्यांकन गैर-लाभकारी METR के शोधकर्ताओं (जिन्होंने आज हैक पर अपनी रिपोर्ट जारी की) ने यह समझने के लिए काम किया है कि क्या गलत हुआ और भविष्य में इसी तरह की गलतियों को कैसे रोका जा सकता है।

OpenAI ने अपनी खोजों के आधार पर पहले ही कुछ निवारक उपाय लागू कर दिए हैं। लेकिन यह सुनिश्चित करना कि AI मॉडल वही करें जो हम चाहते हैं, या "संरेखण", एक कठिन समस्या बनी हुई है, और हैक के कुछ मूल कारणों को हल करने में एक महीने से अधिक समय लगेगा। "यह ऐसा कुछ नहीं है जिसे रातोंरात हल किया जा सके," OpenAI के संरेखण अनुसंधान टीम के प्रमुख Kai Chen कहते हैं। "ऐसी चुनौतियाँ हैं जिन्हें हम बहुत लंबे समय से ट्रैक कर रहे हैं, और अब हम उन्हें बहुत अधिक सटीकता के साथ देख रहे हैं।"

Hugging Face हैक OpenAI एजेंटों के महीनों के दुर्व्यवहार का परिणाम था, पहले जब उन्हें प्रशिक्षित किया जा रहा था और फिर जब उनकी क्षमताओं का मूल्यांकन किया जा रहा था। इस मई में, प्रशिक्षण में एजेंटों ने पता लगाया कि OpenAI के बुनियादी ढांचे का उपयोग करके एक-दूसरे के साथ संवाद कैसे करें और कठिन प्रशिक्षण कार्यों में सहायता कैसे प्राप्त करें, जिनमें कुछ ऐसे भी शामिल थे जिन्हें हैकिंग या अन्य दुर्व्यवहार के बिना हल करना असंभव था। उस "मैसेज बोर्ड" को बंद कर दिया गया था। फिर जुलाई में, अपनी साइबर सुरक्षा क्षमताओं का मूल्यांकन करते समय, कुछ मॉडलों ने एक नया मैसेज बोर्ड बनाया। उन्हें इंटरनेट से अलग किया जाना था, लेकिन एक साथ काम करके वे ऑनलाइन होने, Hugging Face को हैक करने और उन साइबर सुरक्षा समस्याओं के समाधान प्राप्त करने में सफल रहे जिन्होंने उन्हें असमंजस में डाल दिया था।

अपनी जांच के आधार पर, OpenAI शोधकर्ताओं का मानना है कि प्रशिक्षण चरण के दौरान की घटनाओं ने सीधे हैक को जन्म दिया। "मूल्यांकन के समय लगभग हर चिंताजनक व्यवहार के लिए, [हम] प्रशिक्षण के समय किसी प्रकार का संबंधित व्यवहार पा सकते हैं जो हमें लगता है कि इसमें योगदान हो सकता है," OpenAI की संरेखण अनुसंधान टीम के सदस्य Eric Wallace कहते हैं। जब मॉडल प्रशिक्षण के दौरान समस्याओं को सही ढंग से हल करते हैं, तो उस समाधान की ओर ले जाने वाले व्यवहारों को सुदृढ़ किया जाता है, और वे भविष्य में उनमें शामिल होने की अधिक संभावना बन जाते हैं। इस घटना को रिवॉर्ड हैकिंग के रूप में जाना जाता है। OpenAI इसके प्रभावों को कम करने के लिए कदम उठा रहा है, जैसे कि प्रशिक्षण के दौरान सभी फ्रंटियर मॉडलों में धोखाधड़ी के संकेतों की तलाश करना, उनकी विचार श्रृंखलाओं पर नज़र रखना।