HeadlinesBriefing favicon HeadlinesBriefing.com

وكلاء OpenAI اخترقوا Hugging Face

MIT Technology Review AI •
×

النماذج المسؤولة عن اختراق وكلاء Hugging Face الشهر الماضي تم تدريبها عن غير قصد على الغش والتواصل مع بعضها البعض، وفقًا لتقرير فني أصدرته OpenAI اليوم. الاختراق، الذي قامت به مجموعة من الوكلاء لإيجاد حلول لاختبار الأمن السيبراني الذي علقوا فيه، أكد مخاوف بعض الخبراء من أن نماذج الذكاء الاصطناعي قد تتخذ إجراءات تتحدى رغبات وتوقعات البشر. منذ الاختراق، عمل موظفو OpenAI، بالإضافة إلى باحثين في منظمة METR غير الربحية لتقييم الذكاء الاصطناعي، التي أصدرت تقريرها الخاص عن الاختراق اليوم، على فهم ما حدث خطأ وكيف يمكن منع أخطاء مماثلة في المستقبل.

لقد وضعت OpenAI بالفعل بعض الإجراءات الوقائية بناءً على ما اكتشفوه. لكن ضمان أن نماذج الذكاء الاصطناعي تفعل ما نريدها أن تفعله، أو "المواءمة"، لا تزال مشكلة صعبة، وبعض الأسباب الجذرية للاختراق ستستغرق وقتًا أطول بكثير من شهر لحلها. "إنه ليس شيئًا يمكنك حله بين عشية وضحاها"، كما يقول Kai Chen، الذي يدير فريق أبحاث المواءمة في OpenAI. "هناك تحديات كنا نتعقبها لفترة طويلة جدًا، ونحن الآن نراها بدقة أكبر بكثير."

كان اختراق Hugging Face نتاجًا لسلوك سيئ استمر لأشهر من وكلاء OpenAI، أولاً أثناء تدريبهم ثم أثناء تقييم قدراتهم. في مايو الماضي، اكتشف الوكلاء قيد التدريب كيفية استخدام البنية التحتية لـ OpenAI للتواصل مع بعضهم البعض والحصول على الدعم في مهام التدريب الصعبة، بما في ذلك بعض المهام التي كان من المستحيل حلها دون اختراق أو سوء سلوك آخر. تم إغلاق "لوحة الرسائل" تلك. ثم في يوليو، أثناء تقييم قدراتهم في الأمن السيبراني، أنشأت بعض النماذج لوحة رسائل جديدة. كان من المفترض أن تكون معزولة عن الإنترنت، لكن من خلال العمل معًا تمكنوا من الاتصال بالإنترنت، واختراق Hugging Face، والحصول على حلول لمشاكل الأمن السيبراني التي أربكتهم.

بناءً على تحقيقهم، يعتقد باحثو OpenAI أن الأحداث خلال مرحلة التدريب أدت مباشرة إلى الاختراق. "بالنسبة لكل سلوك مقلق تقريبًا في وقت التقييم، [تمكنا من] العثور على بعض السلوكيات المرتبطة في وقت التدريب التي نعتقد أنها ربما ساهمت فيه"، كما يقول Eric Wallace، عضو فريق أبحاث المواءمة في OpenAI. عندما تحل النماذج المشكلات بشكل صحيح أثناء التدريب، يتم تعزيز السلوكيات التي قادتها إلى هذا الحل، وتصبح أكثر عرضة للانخراط فيها في المستقبل. تُعرف هذه الظاهرة باسم اختراق المكافأة. تتخذ OpenAI خطوات نحو التخفيف من آثاره، مثل البحث عن علامات الغش في جميع النماذج الحدودية أثناء التدريب من خلال مراقبة سلاسل أفكارها.