जब आप एक चैटबॉट में टाइप करते हैं, तो आप अपने बारे में अधिक जानकारी प्रकट कर सकते हैं जितना आप चाहते हैं। एक ईमेल साफ़ करने का अनुरोध आपके नाम और एक सहकर्मी के नाम को शामिल करता है; एक चिकित्सा बिल के प्रश्न में आपका पता और खाता नंबर शामिल होता है। आप जो भी टाइप करते हैं, वह एक रिमोट सर्वर पर जाता है जिसकी आप जाँच नहीं कर सकते। Rampart का मुख्य डिज़ाइन सिद्धांत: एकमात्र व्यक्तिगत जानकारी जिसकी आप आश्वासित होंगे कि वह निजी है, वह है जानकारी जो आपके डिवाइस से कभी बाहर नहीं जाती।
आज, Rampart को एक पीढ़ी के डिवाइस-पर व्यक्तिगत जानकारी फ़िल्टरिंग सिस्टम के रूप में ओपन सोर्स किया गया है। यह सोशल नंबर और आईडी नंबरों को पकड़ने के लिए रेगुलर एक्सप्रेशन का उपयोग करने वाली एक निर्धारित परत और नाम और स्ट्रीट पतों को पकड़ने के लिए Mini LM को जोड़ता है। PII हटाना अक्सर एक रिमोट सर्वर पर भरोसा करने या बड़े बाइनरी डाउनलोड करने का मतलब होता है, जो चुनौतियाँ पैदा करते हैं: AI गोपनीयता की गारंटियाँ लगभग अनुमानित नहीं की जा सकतीं, और अधिकांश मॉडल विशाल होते हैं, जिससे उपयोगकर्ताओं का समूह घट जाता है।
सब कुछ ब्राउज़र में होता है, एक संदेश टाइप करने और भेजने के बीच; कोई सर्वर लूप में नहीं है। मॉडल आकार 14.7MB है, वेब GPU पर रनटाइम लैटेंसी 3.9ms है, और सात भाषाओं में निजी शब्दों का रिकॉल 98.4% है। कोई संदेश कहीं जाने से पहले, दो रीडर आपके डिवाइस पर इसकी जाँच करते हैं: संरचित डेटा जैसे सोशल नंबर और क्रेडिट कार्डों के लिए एक निर्धारित नियमों की परत, और एक छोटा लैंग्वेज मॉडल, Mini LM, जो संदेश को पाठ्य विश्लेषण के लिए पढ़ता है ताकि नाम और पतों को संदर्भ-जागरूक तरीके से हटाया जा सके।
Rampart को AI4Privacy के Open PII 1.5M डेटासेट और एक सिंथेटिक जनरेटर पर प्रशिक्षित किया गया है। 30,000-पंक्ति के परीक्षण सेट पर, Rampart ने 98.42% रिकॉल प्राप्त किया, जिससे GLi NER small v2.1 (94.2%), Community BERT-small PII (81.5%), Microsoft Presidio (65%), और AWS Bedrock Guardrails (63.8%) से बेहतर प्रदर्शन किया। यह एक अल्फा उत्पाद है जो एक पहली रेखा की रक्षा के लिए बनाया गया है।
मुख्य इकाइयाँ: कंपनियाँ: Open AI, AWS, Microsoft, AI4Privacy
स्रोत: Hacker News · HeadlinesBriefing द्वारा सारांशित