HeadlinesBriefing favicon HeadlinesBriefing.com

اكتشاف النص المولَّد بواسطة الذكاء الاصطناعي في مجموعات البيانات

Towards Data Science •
×

في ورقتهم البحثية في مؤتمر ICML 2024، طور ويكسين ليانغ، زاكاري إيزو، والمؤلفون المشاركون طريقة لتقدير النص المعدل بواسطة الذكاء الاصطناعي في المجموعات الكبيرة، وتطبيقها على مراجعات الأقران من أربع مؤتمرات رئيسية للذكاء الاصطناعي بعد إطلاق ChatGPT. وجدوا أن 6.5% إلى 16.9% من نص المراجعة يظهر علامات تعديل كبير بواسطة الذكاء الاصطناعي. هذا يسلط الضوء على المخاطر في الإعدادات الهامة مثل مراجعة الأقران، حيث قد يُشوّه المحتوى المولَّد بواسطة الذكاء الاصطناعي التقييم. دراسة Nature 2024 ذات الصلة لإليا شومائيلوف والمؤلفين المشاركين أظهرت أن تدريب النماذج على البيانات المولَّدة بشكل متكرر يؤدي إلى انهيار النموذج، وفقدان أنماط البيانات النادرة، وتضييق المخرجات. اختبر المؤلف ثلاث فحوصات منخفضة التكلفة—الارتباك، التشابه مع التكرار القريب، وكثافة التضمين—على مجموعة بيانات مراجعات الأفلام من Mendeley (2019) لاكتشاف النص المولَّد بواسطة الذكاء الاصطناعي. عند الإعداد الذي يكتشف 80% من المراجعات المولَّدة بواسطة الذكاء الاصطناعي، وضعت كثافة التضمين علامة على 47% من مراجعات المصدر المكتوبة بشرًا. أدى التصفية باستخدام الدرجة المركبة لجميع الفحوصات الثلاث إلى انخفاض دقة تصنيف المشاعر من 67.5% إلى 57.5% على مجموعة محفوظة. تم استنتاج العلامة المكتوبة بشرًا من المصدر (IMDb) وتاريخ النشر قبل ChatGPT، حيث لا تتحقق المجموعة من تأليف الأفراد. تشير هذه النتائج إلى أن الفحوصات القائمة على النص الحالية قد تُفرط في وضع العلامات على المحتوى البشري وتضر بأداء النماذج اللاحقة عند استخدامها بسذاجة للتصفية.