HeadlinesBriefing favicon HeadlinesBriefing.com

ডেটাসেটে AI-উত্পন্ন পাঠের সনাক্তকরণ

Towards Data Science •
×

তাদের 2024ের ICML পেপারে, Weixin Liang, Zachary Izzo এবং সহলেখকদের 의해 বড় সংগ্রহে AI-শোধিত পাঠের অনুমানের জন্য একটি পদ্ধতি উন্নয়ন করা হয়েছে, যা ChatGPT লঞ্চের পর চারটি majeurs AI কনফারেন্সের পিয়ার রিভিউতে প্রয়োগ করা হয়েছে। তারা 6.5% থেকে 16.9% পর্যন্ত রিভিউ পাঠে considérables AI-শোধনের চিহ্ন খুঁজে পেয়েছেন। এটি পিয়ার রিভিউের মতো গুরুত্বপূর্ণ সেটিংসে ঝুঁকি উজागर করে, যেখানে AI-উত্পন্ন বিষয়বস্তু মূল্যায়নকে বিকৃত করতে পারে। একটি সম্পর্কিত 2024ের Nature অধ্যায় Ilia Shumailov এবং সহলেখকদের द्वारा দেখায় যে পুনরাবৃত্তভাবে উত্পন্ন ডেটায় মডেল প্রশিক্ষণ মডেল ধ্বংসের দিকে নিয়ে যায়, दुर्लব ডেটা প্যাটার্ন হারায় এবং আউটপুট সংকুচিত হয়। লেখক Mendeley (2019) থেকে একটি চলচ্চিত্র রিভিউ ডেটাসেটে তিনটি কম খরচের পরীক্ষা—perplexity, near-duplicate similarity, এবং embedding density—AI-উত্পন্ন পাঠ সনাক্ত করার জন্য প্রয়োগ করেছেন। 80% AI-উত্পন্ন রিভিউ पकड़ने वाली সেটিংএ, embedding density 47% মানব-লিখিত উৎস রিভিউকে চিহ্নিত করেছে। তিনটি পরীক্ষার সমবেত স্কোর দিয়ে ফিল্টারিং করলে, হোল্ড-আউট সেটে সেন্টিমেন্ট শ্রেণীবিভাগকারীর সঠিকতা 67.5% থেকে 57.5% এ কমে গেছে। মানব-লিখিত লেবেল উৎস (IMDb) এবং pre-ChatGPT প্রকাশের তারিখ থেকে অনুমান করা হয়েছে, কারণ সংগ্রহটি ব্যক্তিগত লেখকত্ব যাচাই করে না। এই ফলাফলগুলি বোঝায় যে বর্তমান পাঠ-ভিত্তিক পরীক্ষাগুলি মানব বিষয়বস্তুকে অতিরিক্তভাবে চিহ্নিত করতে পারে এবং যদি নাইভভাবে ফিল্টারিংয়ের জন্য ব্যবহার করা হয়, তবে নিম্ন-প্রবাহ মডেলের কর্মক্ষমতা ক্ষতিগ্রস্ত হতে পারে।