HeadlinesBriefing HeadlinesBriefing.com

OpenAI تعطل حملة تقطير النماذج

OpenAI Blog •
×

حددنا مؤخرًا وعطلنا حملة منسقة مصممة لاستخراج التفكير المحمي من نماذجنا، مع أول نشاط ملاحظ يحدث في الأسبوع الأول من يوليو. يتوافق هذا النشاط مع التقطير العدائي: الاستخدام المنهجي وغير المصرح به لمخرجات أو تفكير نموذج واحد للمساعدة في تدريب أو إعادة إنتاج أو تحسين نموذج آخر. قام المشغلون بالتلاعب بتفاعلات النموذج بحيث يمكن إعادة إنتاج التفكير المحمي بأشكال مرئية للطالب بطريقة منسقة ومقياسية انتهكت شروط الخدمة الخاصة بنا.

لاحظنا محاولات المشغلين لاستخراج التفكير المحمي بطرق جديدة، بما في ذلك نسخ التفكير المشفر من محادثة واحدة وطلب نموذج في محادثة أخرى لفك تشفير ونسخ محتوى التفكير المخفي. بدأ النشاط في 1 يوليو، مع ارتفاعات كبيرة في الحجم في 24 و25 يوليو تتكون من 16000 طلب من أكثر من 4000 مستخدم. حدد تحقيق إضافي نشاط نمط Prompt ذي صلة عبر مجموعة تضم أكثر من 15000 مستخدم، والذي عطلناه بالكامل بحلول 28 يوليو.

نعزو مجموعة أساسية من النشاط إلى أفراد مرتبطين بـ Moonshot AI، مطور Kimi. يشكل التقطير العدائي مخاطر على السلامة والأمن القومي. يمكن استخدام التفكير المستخرج لتدريب نموذج آخر دون الحفاظ على الضمانات المطبقة على مخرجات النموذج الأصلي الموجهة للمستخدم.

خففنا من حملة التقطير الأخيرة هذه من خلال مزيج من إنفاذ الحساب والضوابط الفنية والتنسيق مع الشركاء. كما قمنا بتعزيز الحماية للتفكير المخفي عبر المستخدمين ومساحات العمل والمؤسسات وعائلات النماذج.

المصدر: OpenAI Blog · لخّصه HeadlinesBriefing