HeadlinesBriefing favicon HeadlinesBriefing.com

भाषाई अपठनीयता LLM सुरक्षा को खतरा

Hacker News •
×

LLM को प्राकृतिक भाषा उत्पन्न करने के लिए प्रशिक्षित किया जाता है। हालाँकि, साक्ष्य बताते हैं कि LLM के बाहरी भाषाई आउटपुट और यांत्रिक रूप से निकाले गए भाषाई लक्षण आंतरिक मॉडल गणना को समझने के लिए एक अविश्वसनीय लेंस हो सकते हैं। हम "भाषाई अपठनीयता" शब्द पेश करते हैं, जो व्यापक रूप से उन परिदृश्यों को संदर्भित करता है जिनमें LLM के बाहरी या यांत्रिक रूप से जाँचे गए भाषाई आर्टिफैक्ट यह प्रस्तुत करने में विफल रहते हैं कि मॉडल वास्तव में कैसे सोचता है। हम तर्क देते हैं कि भाषाई अपठनीयता का भूत उन LLM के लिए अपरिहार्य है जिनकी आंतरिक गणनाएँ सीधे भाषा के माध्यम से व्यक्त नहीं होतीं, बल्कि सक्रियण स्थानों पर गणित के माध्यम से होती हैं (सक्रियण स्थानों और प्राकृतिक भाषा के बीच दोनों सिरों पर हानिपूर्ण अनुवाद होते हैं)।

यदि भाषाई अपठनीयता हमेशा संभव है, तो मॉडल की भाषाई स्व-रिपोर्टिंग पर निर्भर सुरक्षा तंत्र (जैसे, चिंतन-श्रृंखला निगरानी, संवैधानिक आत्म-आलोचना, भाषाई रूप से परिभाषित फीचर वैक्टर के लिए सक्रियण जाँच) कभी भी पूरी तरह से विश्वसनीय नहीं हो सकते; मॉडल सैंडबॉक्स को हमेशा ऐसी अलगाव तकनीकों की आवश्यकता होगी जिनकी गारंटी मॉडल की भाषाई स्थिति को पढ़ने पर बिल्कुल भी निर्भर न हो। हम तर्क देते हैं कि टेन्ट ट्रैकिंग का उपयोग करके मॉडल के आउटपुट का अवलोकन करना एक प्रभावी सैंडबॉक्स के लिए एक आशाजनक दृष्टिकोण है: चाहे मॉडल भाषाई रूप से कैसे भी स्व-रिपोर्ट करे, एक टेन्ट ट्रैकिंग नीति प्राथमिक रूप से सिस्टम स्थिति के विभिन्न हिस्सों को परिभाषित कर सकती है जो मॉडल-निर्मित डेटा से कभी प्रभावित नहीं होने चाहिए।

हम कई अतिरिक्त सैंडबॉक्सिंग तंत्रों पर भी चर्चा करते हैं (जैसे, मजबूत वर्चुअलाइजेशन, सैंडबॉक्सिंग कॉन्फ़िगरेशन की तृतीय-पक्ष ऑडिटिंग) जो सामूहिक रूप से भाषाई निगरानी के नीचे एक महत्वपूर्ण तल प्रदान करते हैं, और फ्रंटियर मॉडल्स द्वारा हाल के सैंडबॉक्स शोषणों को कम कर सकते थे।