HeadlinesBriefing favicon HeadlinesBriefing.com

مبادئ OpenAI لتقييمات الأطراف الثالثة

OpenAI Blog •
×

تتحمل مختبرات الذكاء الاصطناعي المتقدمة مسؤولية هائلة في تدريب وتقييم ونشر النماذج بأمان. تُعد تقييمات الأطراف الثالثة جزءًا حاسمًا من موازنة تلك المسؤولية، وتوسيع فرص المساهمة في سلامة الذكاء الاصطناعي، وإبقاء العالم على اطلاع، وإبقاء المختبرات مسؤولة عن ادعاءات السلامة الواضحة والمدعومة بشكل مستقل. كجزء من جهودنا لمواكبة الحدود المتقدمة، تلتزم OpenAI بدعم التقييمات المستقلة بمستويات عميقة من الوصول عبر التدريب والتقييم والنشر. يجب أن يمكّن هذا الوصول المقيمين من تحدي افتراضاتنا، وتحديد المخاطر التي ربما فاتتنا، والتوصل إلى استنتاجاتهم الخاصة حول فعالية ضماناتنا.

لقد عملنا منذ فترة طويلة مع مقيمي الأطراف الثالثة في مراحل مختلفة من عملية تطوير النماذج ونشرها. كما أدرجنا تقييمات الأطراف الثالثة في ممارسات إطار الاستعداد لدينا ودعمنا المنظمات والتشريعات التي تدعو إلى عملية أكثر صرامة ومسؤولية. خلال هذه المشاركات، قدمنا أشكالًا عميقة من الوصول، بما في ذلك معلومات حول ضماناتنا التقنية، والوصول المرئي إلى سلسلة التفكير، ومستويات غير مسبوقة من البيانات السرية والوصول الداخلي إلى النشر للاستجابة للحوادث والفريق الأحمر للمراقبة. تركز الأولويات والمبادئ المشتركة هنا على مشاركتنا مع منظمات التقييم المستقلة في القطاعين الخاص وغير الربحي بشأن تقييمات السلامة التقنية. وهي تكمل عملنا مع الحكومات في الاختبار والتقييم، حيث قد تتطلب الأدوار والمسؤوليات المتميزة أساليب مختلفة.

يتطلب جعل هذه التقييمات فعالة آليات قوية للاستقلالية، وصرامة علمية، وممارسات أمنية قوية، ومسؤوليات واضحة. تتحمل المختبرات مسؤولية تمكين التدقيق الهادف مع حماية المعلومات الحساسة. يتشارك المختبرات والمقيّمون المستقلون المسؤولية عن القيام بذلك بشكل صحيح، وينبغي أن يعملوا بمعايير دولية مشتركة لممارسات السلامة والأمن. أدناه، نقترح أربعة مجالات ذات أولوية للتقييم الأعمق، إلى جانب مبادئ للعمل الصارم والآمن والمستقل.

المجالات ذات الأولوية للتقييم: تكون تقييمات الأطراف الثالثة أكثر فائدة عندما تتناول أسئلة محددة وذات عواقب: هل تدعم الأدلة حالة السلامة وادعاءات السلامة الخاصة بالمختبر؟ هل تختبر التقييمات بشكل كافٍ المخاطر التي تهدف إلى قياسها؟ هل تعمل الضمانات في ظروف واقعية؟ تهدف التقييمات الموصوفة هنا إلى اتخاذ أشكال مختلفة اعتمادًا على أسئلة السلامة التي يتم فحصها. نتوقع دعم تقييمات متعددة بالتوازي وعلى فترات زمنية مختلفة، بعضها يستمر أسابيع والبعض الآخر عدة أشهر. بينما يمكن أن تكون تقييمات الأطراف الثالثة أيضًا جزءًا من العمل قبل النشر وقد تُعلم قرارات النشر، فإن العمل الموصوف هنا عادة ما يكون طويل الأجل ومستقل عن الإطلاق—يركز على فحص ادعاءات سلامة معينة بعمق بمرور الوقت. في مجالات أولوياتنا ومبادئنا، نشير إلى ادعاءات السلامة وحالات السلامة. ما نعنيه بهذه المصطلحات هو ما يلي: نقترح أربعة مجالات ذات أولوية للتقييم الأعمق، إلى جانب مبادئ للعمل الصارم والآمن والمستقل. التقييم المستقل لحالات السلامة، التي تشمل التدريب والتقييم والنشر الداخلي والنشر الخارجي. يتطلب تقييم حالات السلامة خبرة في المواءمة، وأساليب التحكم مثل المراقبة، والأمن السيبراني، وسوء الاستخدام البيولوجي والكيميائي، والفريق الأحمر. تتكون حالات السلامة من ادعاءات تشمل التدريب وتقييمات القدرات والضمانات، والتي يمكن تقييمها ككل أو في أجزاء (انظر الأولويات 2 و3 أدناه). من المحتمل أن يحتاج عدة مقيمين إلى فحص أجزاء مختلفة من الحالات، بالاعتماد على خبراتهم respective. معًا، يجب أن تجيب تقييماتهم على أسئلة مثل: هل الأدلة لحالات السلامة للتدريب والتقييم والنشر مدعومة؟ هل تم اتباع شروط حالة السلامة أثناء التدريب والتقييم...

سؤال