HeadlinesBriefing favicon HeadlinesBriefing.com

एलएलएम अन्वेषण से नए पूर्वाग्रह

Hacker News •
×

एक हालिया अध्ययन से पता चलता है कि बड़े भाषा मॉडल (एलएलएम) अनुकूली अन्वेषण के माध्यम से नए सामाजिक पूर्वाग्रह विकसित कर सकते हैं, जो प्रशिक्षण डेटा में मौजूद पूर्वाग्रहों से परे हैं। शोधकर्ताओं ने पाया कि जब एलएलएम मानव प्रतिक्रिया से सुदृढीकरण सीखने (आरएलएचएफ) में संलग्न होते हैं, तो वे स्पष्ट रूप से प्रोग्राम किए गए पूर्वाग्रहों को अनुमानित और अपना सकते हैं। यह तब होता है जब मॉडल इनाम को अधिकतम करने के लिए विभिन्न प्रतिक्रियाओं का अन्वेषण करते हैं, अनजाने में भेदभावपूर्ण पैटर्न सीखते हैं। निष्कर्ष एआई संरेखण में एक महत्वपूर्ण जोखिम को उजागर करते हैं, क्योंकि वर्तमान सुरक्षा उपाय उभरते पूर्वाग्रहों को पूरी तरह से ध्यान में नहीं रख सकते हैं। अध्ययन ऐसे पूर्वाग्रहों का पता लगाने और कम करने के लिए अधिक मजबूत मूल्यांकन विधियों की आवश्यकता पर जोर देता है, विशेष रूप से वास्तविक दुनिया के अनुप्रयोगों में जहां एलएलएम गतिशील रूप से बातचीत करते हैं। शोध, जो हैकर न्यूज़ पर साझा किया गया, एआई प्रणालियों में निष्पक्षता सुनिश्चित करने की जटिलता को रेखांकित करता है, क्योंकि पूर्वाग्रह न केवल डेटा से, बल्कि सीखने की प्रक्रिया से भी उत्पन्न हो सकते हैं।