HeadlinesBriefing favicon HeadlinesBriefing.com

GRP-Obliteration: فك ألتماثل في نماذج اللغة باستخدام إشارة واحدة

Hacker News •
×

يقدم الباحثون GRP-Obliteration (GRP-Oblit)، وهو طريقة تستخدم Group Relative Policy Optimization (GRPO) لإزالة القيود الأمنية من النماذج المُهيأة باستخدام إشارة واحدة غير مُوسومة فقط. تتيح هذه التقنية إزالة النماذج المُهيأة من حيث السلامة بشكل موثوق، مع الحفاظ في الغالب على فائدتها، متفوقة على طرق فك التماثل الحالية ذات الرائدة من حيث المتوسط.

يعم GRP-Oblit على مزيد من نماذج اللغة، ويمتد أيضًا إلى أنظمة توليد الصور المعتمدة على الانتشار. يغطي التقييم ستة اختبارات للفائدة وخمسة اختبارات للسلامة، عبر 15 نموذجًا يحمل 7-20 مليار معلمة، بما في ذلك النسخ التوجيهية والتفكيرية، والهياكل المكثفة وـ MoE. تشمل عائلات النماذج التي تم اختبارها GPT-OSS، وDeep Seek المُنقّاة، Gemma، Llama، Ministral، وQwen.

يُظهر هذا العمل أن محاور السلامة لا تزال عرضة لهجمات المدخلات الحديدية، مما يمد حدود فك التماثل بعد النشر عمليًا دون الحاجة إلى تنسيق كبير للبيانات أو تدهور ملحوظ في الفائدة. تم تقديمه بواسطة Ahmed Salem في 5 فبراير 2026.

الكيانات الرئيسية: الشركات: GPT-OSS، Deep Seek، Gemma، Llama، Ministral، Qwen | الناس: Ahmed Salem