HeadlinesBriefing favicon HeadlinesBriefing.com

डबल-ब्लाइंड AI मूल्यांकन

Google DeepMind Blog •
×

AI बेंचमार्क परिणाम तिरछे हो सकते हैं यदि मॉडल परीक्षण प्रश्नों को पहले से देख लेते हैं, यह समस्या बेंचमार्क संदूषण के रूप में जानी जाती है। इसे संबोधित करने के लिए, Google DeepMind एक स्वामित्व वाले सीमांत मॉडल का दुनिया का पहला डबल-ब्लाइंड मूल्यांकन शुरू कर रहा है। यह दृष्टिकोण बाहरी मूल्यांकन को एक क्रिप्टोग्राफिक 'बॉक्स' में रखता है ताकि उन्हें परीक्षण से पहले प्रदर्शन को अनुकूलित करने के लिए उपयोग नहीं किया जा सके।

Google सिंगापुर AI सुरक्षा संस्थान, OpenMined, AVERI और MLCommons के साथ साझेदारी कर रहा है ताकि गोपनीयता-संरक्षण वातावरण में गोपनीय बेंचमार्क के खिलाफ Gemini Flash Lite मॉडल का परीक्षण किया जा सके। यह मॉडल को प्रश्नों पर 'झांकने' से रोककर मूल्यांकन की अखंडता को बढ़ाता है।

पहले, बाहरी साझेदार परीक्षण संकेतों को गोपनीय रखने के लिए शून्य-लॉगिंग प्रोटोकॉल और अनुबंधात्मक सुरक्षा उपायों का उपयोग करते थे। तकनीकी और क्रिप्टोग्राफिक सुरक्षा उपायों को जोड़ना एक बड़ा कदम है। नीति निर्माताओं, शोधकर्ताओं और उद्यमों को मॉडल की वास्तविक क्षमताओं और सुरक्षा को सटीक रूप से दर्शाने के लिए भरोसेमंद बेंचमार्क की आवश्यकता है।

प्रमुख संस्थाएँ: कंपनियाँ: Google DeepMind, OpenMined, MLCommons | स्थान: सिंगापुर