HeadlinesBriefing favicon HeadlinesBriefing.com

डेटासेट में AI-जनित पाठ की पहचान

Towards Data Science •
×

उनके 2024 के ICML पेपर में, Weixin Liang, Zachary Izzo और सहलेखकों ने बड़े संग्रह में AI-संशोधित पाठ का अनुमान लगाने की एक विधि विकसित की, जिसे ChatGPT लॉन्च के बाद चार प्रमुख AI सम्मेलनों के पीयर रिव्यू पर लागू किया। उन्होंने पाया कि समीक्षा पाठ का 6.5% से 16.9% तक considerable AI संशोधन के संकेत दिखाता है। यहpeer review जैसे महत्वपूर्ण सेटिंग्स में जोखिम को उजागर करता है, जहाँ AI-जनित सामग्री मूल्यांकन को विकृत कर सकती है। एक संबंधित 2024 के Nature अध्ययन में Ilia Shumailov और सहलेखकों ने दिखाया कि पुनरावृत्त रूप से उत्पन्न डेटा पर मॉडल प्रशिक्षण मॉडल गिरावट का कारण बनता है, दुर्लभ डेटा पैटर्न खो देता है और आउटपुट को संकीर्ण कर देता है। लेखक ने Mendeley (2019) से फिल्म समीक्षा डेटासेट पर तीन कम लागत वाली जाँचें—perplexity, near-duplicate समानता, और embedding घनत्व—AI-जनित पाठ का पता लगाने के लिए परीक्षण किए। एक सेटिंग में जो 80% AI-जनित समीक्षाओं को पकड़ती है, embedding density ने मानव-लिखित स्रोत समीक्षाओं के 47% को चिह्नित किया। सभी तीन जाँचों के संयुक्त स्कोर का उपयोग करके फ़िल्टर करने पर, होल्ड-आउट सेट पर भावना वर्गीकरणकर्ता की सटीकता 67.5% से घटकर 57.5% रह गई। मानव-लिखित लेबल को स्रोत (IMDb) और pre-ChatGPT प्रकाशन तिथि से अनुमानित किया गया, क्योंकि संग्रह व्यक्तिगत लेखनीयता की पुष्टि नहीं करता है। ये परिणाम बताते हैं कि वर्तमान पाठ-आधारित जाँचें मानव सामग्री को अतिरिक्त रूप से चिह्नित कर सकती हैं और यदि naïve तरीके से फ़िल्टरिंग के लिए उपयोग की जाएं तो नीचे के मॉडल प्रदर्शन को नुकसान पहुंचा सकती हैं।