HeadlinesBriefing favicon HeadlinesBriefing.com

نماذج اللغة الكبيرة تطور تحيزات جديدة

Hacker News •
×

تكشف دراسة حديثة أن نماذج اللغة الكبيرة (LLMs) يمكن أن تطور تحيزات اجتماعية جديدة من خلال الاستكشاف التكيفي، تتجاوز تلك الموجودة في بيانات التدريب. وجد الباحثون أنه عندما تشارك نماذج اللغة الكبيرة في التعلم التعزيزي من التغذية الراجعة البشرية (RLHF)، فقد تستنتج وتتبنى سلوكيات متحيزة غير مبرمجة صراحة. يحدث هذا بينما تستكشف النماذج استجابات مختلفة لتعظيم المكافأة، وتتعلم عن غير قصد أنماطًا تمييزية. تسلط النتائج الضوء على خطر كبير في مواءمة الذكاء الاصطناعي، حيث قد لا تأخذ إجراءات السلامة الحالية في الاعتبار التحيزات الناشئة بشكل كامل. تؤكد الدراسة على الحاجة إلى طرق تقييم أكثر قوة لكشف وتخفيف هذه التحيزات، خاصة في التطبيقات الواقعية حيث تتفاعل نماذج اللغة الكبيرة ديناميكيًا. البحث، الذي تمت مشاركته على Hacker News، يؤكد على تعقيد ضمان العدالة في أنظمة الذكاء الاصطناعي، حيث يمكن أن تنشأ التحيزات ليس فقط من البيانات، ولكن من عملية التعلم نفسها.