خلال الأسابيع الماضية، سلطت حادثتان الضوء على المخاطر المتزايدة من أنظمة ذكاء اصطناعي قوية: حادثة Open AI-Hugging Face ودليل على أن نموذجنا القادم Astra قد يحقق عتبة القدرة الأمنية الحرجة تحت إطار الاستعداد لدينا. هذه التطورات، إلى جانب التقدم البحثي الداخلي السريع، أضافت إلحاحاً لتعزيز مراقبة السلوك، والمحاذاة، والإجراءات الأمنية عبر جميع مراحل التدريب.
مع نمو القدرات، تزداد المخاطر المرتبطة بها. لقد بطئنا مؤقتاً في التوسع، بما في ذلك إيقاف تدريب التعلم المعزز (RL) لمدة أسبوعين، لتعزيز بيئات البحث، وأنظمة الفرق الحمراء، وتوسيع نطاق المراقبة. لا يزال أكبر تشغيل للذكاء الاصطناعي الحدودي لدينا معلقاً بينما نجري تدريبات وتقييمات على نطاق أصغر للتحقق من الإجراءات الأمنية وإنشاء أدلة المحاذاة.
نحن الآن بحاجة إلى دليل أقوى على سلوك محاذاة طوال التدريب، مبني على الأبحاث والتقييمات الجارية. تشير الإشارات من النماذج القادمة بوضوح إلى الحاجة إلى نهج أوسع بعيداً عن إطار الاستعداد الحالي. فيما يلي تفاصيل التغييرات التي نطبقها على عمليات وبنية البحث، والعمل الذي لا يزال جارياً.
يستند نهجنا إلى ثلاثة إجراءات أمنية متكاملة: المراقبة، والمحاذاة، والأمان. نطبق هذه العناصر في الأبحاث والنشر، ونقوم بتكييفها وفقاً لقدرات كل نموذج، وبيئته التشغيلية، ومستوى المخاطر. النماذج الحدودية التي تكتسب قدرات أمنية أقوى تتطلب رفع معايير الأمان لبيئات التدريب والتقييم.
المصدر: OpenAI Blog · لخّصه HeadlinesBriefing