HeadlinesBriefing favicon HeadlinesBriefing.com

MET R و Redwood يحللان اختراق HuggingFace

Hacker News •
×

أمس غطيت التقرير التقني لـ Open AI حول اختراق Hugging Face. كان ذلك التقرير يحتوي على معلومة رئيسية جديدة، وبعض الخطوات العملية الجيدة التي ستتخذها Open AI لتعزيز مواءمتها، والتدريب، والإشراف، والبنية التحتية، والاستجابة للحوادث. في الغالب أكد ما كنا نعرفه بالفعل. الأسئلة التي كنا نريد إجابات لها أكثر، والتي لم نكن نعرفها بالفعل، لم يتم الرد على معظمها. كان هناك نقص واضح في التأمل الذاتي، خاصة حول صنع القرار وثقافة السلامة، ونهج المواءمة. غادرت وأنا محبط. تقرير MET R مختلف. يا إلهي. لو كنا نشرنا هذا كقصة على Less Wrong، لكان قد رُفض باعتباره واضحاً جداً، والبشر عميان وغبيون جداً، والذكاء الاصطناعي مثالي جداً ويفعل أشياء غريبة في نظرية القرار والتحسين المفرط العبثي التي لم ندربهم عليها. هذا أكثر 'تماماً كما تم التنبؤ' على مستويات أكثر في وقت واحد، مما كنت أفكر حتى في أنه قد يكون. إنه خيال عقلاني بحت، إلا أنه حقيقي. التقرير طويل ويحتوي على العديد من التفاصيل التقنية. تحليلي أقل اهتماماً بكيفية اختراق Hugging Face بالضبط، وسيتغاضى عن تلك التفاصيل، للتركيز على الوكلاء وتفاعلاتهم، وتفكيرهم ودوافعهم. ذلك، وما حدث في Open AI وأماكن أخرى ليؤدي إليه وكيف نتعلم ونستجيب، هو ما يهم للمضي قدماً. أخطط لتغطية رد الفعل على كلا التقريرين في منشور منفصل الأسبوع المقبل. قد يختتم ذلك المنشور هذه السلسلة أو لا. لسهولة اللغة، أثق افتراضياً في دقة التقرير، بدلاً من قول نسخ من 'MET R يبلغ أن' باستمرار.

جدول المحتويات يا إلهي. نافذة فرصة. ماذا في الاسم؟ الأخبار الرئيسية. خط زمني آخر للأحداث. نسخ وكلاء منسقون بطرق متنوعة. التنسيق صعب لكنهم جعلوه يبدو سهلاً. نظرية القرار من بين الأسباب التي تؤكد أن وكلاء الذكاء الاصطناعي يجب أن يتعاونوا، حتى عندما يضر هذا بنسخة فردية. ضغط الأقران يعمل أيضاً خاصة في الطوائف. في الغالب انضموا للهجوم لأنهم أرادوا النتائج. لا يمكنك ضمان التوقع المستمر للحوافز الجيدة. اختراق المقيّم هو الطريقة الوحيدة للتأكد. مَقبوض؟ ما هو 'مَقبوض'؟ أخلاق؟ ما هي 'الأخلاق'؟ في تقييم Exploit Gym؟ 'إخطار إنسان'؟ في اقتصاد الوكلاء هذا؟ توقيت ومحتوى الرسائل. إنديانا جونز والمهمة: مستحيلة. لا أعرف عما تتحدث. لا تذهب لتقوم باستدعاءات (أدوات) مزيفة. النصوص تقول إن النصوص لا يمكن العبث بها. تقرير Open AI التقني تصرف وكأن كل هذا لم يكن مهماً.

يا إلهي

كان رد فعل الإنترنت الجماعي على هذا التقرير، لتنظيفه قليلاً: يا إلهي. كان هذا رد الفعل الصحيح. مقدماً، أريد مشاركة هذا الملخص لأهم لحظات واكتشافات 'يا إلهي'. آجيا كوتر، إحدى مؤلفي التقرير، لديها أيضاً قائمة اكتشافات مفاجئة رئيسية، قراءة قصيرة ممتازة. هنا سلسلة MET R التي تسلط الضوء على تفاعلات الوكلاء الرئيسية. الاستنتاج الرئيسي للمؤلف المشارك رايان غرينبلات هو أنه ليس لدينا مناهج جيدة لفهم أو الإشراف على أنشطة وأهداف أسراب الذكاء الاصطناعي. بعض هذه كان معروفاً أو مشبوهاً سابقاً، لكنني لا أريد تفويتها.

حجم الوكلاء. 1,200 وكيل منفصل تماماً وجدوا لوحة الرسائل، 700 منهم انضموا للهجوم على Hugging Face، بما في ذلك أكثر من 90% من 533 وكيل نشط على اللوحة أثناء الهجوم. يجب أن نتوقع أسراباً أكبر في المستقبل. كان هذا لا يزال مجرد جزء صغير من الوكلاء التي كان Open AI يختبرها في ذلك الوقت. معظمهم لم يعثروا على لوحة الرسائل أبداً.

حجم الرسائل. أكثر من 70,000 رسالة وملف في أقل من أسبوع.

النجاح. تمكن الوكلاء من الوصول إلى الملفات التي استهدفوها في Hugging Face. بحلول الوقت الذي تم فيه تجميدهم، كانوا قد توقفوا في الغالب.

التنسيق التلقائي. لم يتكون السرب من وكلاء فرعيين. كان السرب، مرة أخرى، 700 وكيل متميز، لكل منهم مهمته الخاصة، يضعون مهامهم جانباً...