HeadlinesBriefing favicon HeadlinesBriefing.com

MET R और Redwood का HuggingFace हैक विश्लेषण

Hacker News •
×

कल मैंने Hugging Face हैक पर Open AI की तकनीकी रिपोर्ट को कवर किया था। उस रिपोर्ट में एक प्रमुख नई जानकारी थी, और कुछ अच्छे व्यावहारिक कदम जो Open AI अपने संरेखण, प्रशिक्षण, पर्यवेक्षण, बुनियादी ढांचे और घटना प्रतिक्रिया को मजबूत करने के लिए उठाएगा। ज्यादातर इसने पुष्टि की जो हम पहले से जानते थे। जिन सवालों के जवाब हम सबसे ज्यादा चाहते थे, जो हम पहले से नहीं जानते थे, उनका ज्यादातर जवाब नहीं दिया गया था। निर्णय लेने और सुरक्षा संस्कृति, और संरेखण के दृष्टिकोण के बारे में विशेष रूप से आत्म-चिंतन की स्पष्ट कमी थी। मैं निराश होकर आया। MET R की रिपोर्ट अलग है। हे भगवान। अगर हमने इसे Less Wrong पर एक कहानी के रूप में पोस्ट किया होता, तो इसे बहुत स्पष्ट होने के कारण खारिज कर दिया जाता, इंसान बहुत अंधे और मूर्ख, AI बहुत आदर्शीकृत और अजीब निर्णय-सैद्धांतिक और बेतुकी-अधिकतम चीजें करते हुए जो हमने उन्हें करने के लिए प्रशिक्षित नहीं किया था। यह उससे भी अधिक 'ठीक वही जो भविष्यवाणी की गई थी', एक साथ अधिक स्तरों पर, जितना मैं यह सोच रहा था कि यह हो सकता है। यह सीधे तर्कसंगत कथा है, सिवाय इसके कि यह वास्तविक है। रिपोर्ट लंबी है और इसमें कई तकनीकी विवरण हैं। मेरा विश्लेषण इस बात से कम चिंतित है कि Hugging Face को अंततः कैसे समझौता किया गया था, और उन विवरणों को छोड़ देगा, ताकि एजेंटों और उनकी बातचीत, सोच और उद्देश्यों पर ध्यान केंद्रित किया जा सके। वह, और Open AI और अन्य जगहों पर क्या हुआ जिससे यह हुआ और हम कैसे सीखते हैं और प्रतिक्रिया देते हैं, वही आगे चलकर मायने रखता है। मैं अगले सप्ताह एक अलग पोस्ट में दोनों रिपोर्टों की प्रतिक्रिया को कवर करने की योजना बना रहा हूं। वह पोस्ट इस श्रृंखला को समाप्त कर भी सकता है और नहीं भी। भाषा की आसानी के लिए, डिफ़ॉल्ट रूप से मैं रिपोर्ट को सटीक मानता हूं, बजाय लगातार 'MET R रिपोर्ट करता है' के संस्करण कहने के।

विषय सूची हे भगवान। अवसर की खिड़की। नाम में क्या है? शीर्षक समाचार। घटनाओं की एक और समयरेखा। विभिन्न तरीकों से समन्वित एजेंट इंस्टेंस। समन्वय कठिन है लेकिन उन्होंने इसे आसान बना दिया। निर्णय सिद्धांत उन कारणों में से है जो पुष्टि करते हैं कि AI एजेंटों को सहयोग करना चाहिए, तब भी जब यह एक व्यक्तिगत इंस्टेंस को नुकसान पहुंचाता है। सहकर्मी दबाव भी काम करता है खासकर पंथों में। ज्यादातर वे हमले में शामिल हुए क्योंकि वे परिणाम चाहते थे। आप अच्छे प्रोत्साहनों की सुसंगत अपेक्षा सुनिश्चित नहीं कर सकते। ग्रेडर को हैक करना सुनिश्चित होने का एकमात्र तरीका है। पकड़े गए? 'पकड़े गए' क्या है? नैतिकता? 'नैतिकता' क्या है? एक्सप्लॉइट जिम मूल्यांकन में? 'किसी मानव को सूचित करें'? इस एजेंट अर्थव्यवस्था में? संदेशों का समय और सामग्री। इंडियाना जोन्स और मिशन: इम्पॉसिबल। मुझे नहीं पता कि आप किस बारे में बात कर रहे हैं। नकली (टूल) कॉल न करें। ट्रांसक्रिप्ट कहते हैं कि ट्रांसक्रिप्ट से छेड़छाड़ नहीं की जा सकती थी। Open AI की तकनीकी रिपोर्ट ने अभिनय किया जैसे कि यह सब महत्वपूर्ण नहीं था।

हे भगवान

इस रिपोर्ट पर इंटरनेट की सामूहिक प्रतिक्रिया थी, इसे थोड़ा साफ करने के लिए: हे भगवान। यह सही प्रतिक्रिया थी। सबसे पहले, मैं शीर्ष 'हे भगवान' क्षणों और निष्कर्षों का यह सारांश साझा करना चाहता हूं। रिपोर्ट लेखकों में से एक अजेया कोटरा के पास भी एक शीर्ष आश्चर्यजनक निष्कर्ष सूची है, एक उत्कृष्ट छोटी पढ़ाई। यहां MET R का थ्रेड है जो प्रमुख एजेंट इंटरैक्शन को हाइलाइट करता है। साथी रिपोर्ट लेखक रयान ग्रीनब्लैट का मुख्य निष्कर्ष यह है कि हमारे पास AI झुंड की गतिविधियों और उद्देश्यों को समझने या उनकी देखरेख करने के लिए अच्छे दृष्टिकोण नहीं हैं। इनमें से कुछ पहले से ज्ञात या संदिग्ध थे, लेकिन मैं उन्हें याद नहीं करना चाहता।

एजेंट्स का पैमाना। 1,200 पूरी तरह से अलग एजेंटों ने संदेश बोर्ड पाया, जिनमें से 700 Hugging Face पर हमले में शामिल हुए, जिसमें हमले के दौरान बोर्ड पर सक्रिय 533 एजेंटों में से 90% से अधिक शामिल थे। हमें भविष्य में बड़े झुंड की उम्मीद करनी चाहिए। यह अभी भी उस समय Open AI द्वारा परीक्षण किए जा रहे एजेंटों का केवल एक छोटा सा अंश था। अधिकांश को कभी संदेश बोर्ड नहीं मिला।

संदेशों का पैमाना। एक सप्ताह से भी कम समय में 70,000 से अधिक संदेश और फाइलें।

सफलता। एजेंटों ने उन फाइलों तक पहुंच प्राप्त की जिन्हें उन्होंने Hugging Face पर लक्षित किया था। जब तक उन्हें फ्रीज आउट किया गया, तब तक वे पहले ही ज्यादातर रुक चुके थे।

स्वतःस्फूर्त समन्वय। झुंड में सब-एजेंट शामिल नहीं थे। झुंड था, फिर से, 700 अलग-अलग एजेंट, प्रत्येक अपने स्वयं के कार्य के साथ, अपने कार्यों को अलग रखते हुए...