HeadlinesBriefing favicon HeadlinesBriefing.com

AI वॉटरमार्क बनाम मतिभ्रम जाँच

Towards Data Science •
×

AI सुरक्षा में एक मित्र-आग की समस्या है। जो तकनीक यह साबित करती है कि AI पाठ कहाँ से आया है, वह उस तकनीक को कमजोर कर रही है जो जाँचती है कि यह सत्य है या नहीं। वॉटरमार्किंग, या उत्पन्न पाठ में एक छिपे हस्ताक्षर को एम्बेड करना, AI अनुप्रयोगों पर पारदर्शिता बढ़ाने के लिए उपयोग किया जाता है (यूरोप का EU AI Act अनुच्छेद 50; चीन का AI लेबलिंग विनियमन)। इसके अलावा, मतिभ्रम पहचान उत्तर के उन हिस्सों को चिह्नित करने का प्रयास करती है जो मॉडल ने बनाए हैं। नियामक दोनों को आगे बढ़ा रहे हैं, लेकिन AI मॉडल के भीतर पारदर्शिता और दायित्व के बीच एक छिपी टक्कर मौजूद है।

एक LLM अगले टोकन पर संभाव्यता वितरण की गणना करता है। कभी-कभी वह वितरण तीव्र होता है, जैसे "फ्रांस की राजधानी है" के बाद, जहाँ "पेरिस" मजबूर है। कभी-कभी यह सपाट होता है, कई निरंतरताएँ समान रूप से संभव होती हैं। सपाटपन को एन्ट्रॉपी कहा जाता है। दोनों तकनीकें उच्च-एन्ट्रॉपी स्थितियों में रहती हैं। एक पाठ वॉटरमार्क एक गुप्त कुंजी का उपयोग करके सिक्के के उछाल को पक्षपाती बनाता है, जैसे कि Kirchenbauer और सहकर्मियों की 2023 योजना, जो शब्दावली को हरी और लाल सूचियों में विभाजित करती है। पाठ स्वाभाविक रूप से पढ़ा जाता है लेकिन इसमें अधिक हरे टोकन होते हैं।

कुंजी वाला एक डिटेक्टर हरे टोकन गिनता है और असंभाव्यता की गणना करता है। Google DeepMind का Synth ID-Text, Gemini मॉडल में, टूर्नामेंट सैंपलिंग का उपयोग करता है। विरूपण-मुक्त योजनाएँ पक्षपात को व्यवस्थित करती हैं ताकि आउटपुट वितरण औसतन अपरिवर्तित रहे। लेकिन एक वॉटरमार्क केवल वहीं धकेल सकता है जहाँ जगह है। कम-एन्ट्रॉपी स्थितियों में, पक्षपात का अर्थ गलत शब्द और गुणवत्ता का पतन होगा। टक्कर मॉडल के आंतरिक भागों में छिपी है लेकिन AI सुरक्षा के लिए वास्तविक परिणाम हैं।

मुख्य संस्थाएँ: कंपनियाँ: Google DeepMind | लोग: Kirchenbauer