HeadlinesBriefing favicon HeadlinesBriefing.com

تقييمات الذكاء الاصطناعي مزدوجة التعمية

Google DeepMind Blog •
×

يمكن أن تكون نتائج معايير الذكاء الاصطناعي منحرفة إذا رأت النماذج أسئلة الاختبار مسبقًا، وهي مشكلة تعرف باسم تلوث المعايير. لمعالجة هذا، تختبر Google DeepMind أول تقييم مزدوج التعمية في العالم لنموذج حدودي مملوك. يحافظ هذا النهج على التقييمات الخارجية في 'صندوق' تشفيري بحيث لا يمكن استخدامها لتحسين الأداء قبل الاختبار.

تتعاون Google مع معهد سنغافورة لسلامة الذكاء الاصطناعي، وOpenMined، وAVERI، وMLCommons لاختبار نموذج Gemini Flash Lite ضد معايير سرية في بيئة تحافظ على الخصوصية. هذا يزيد من نزاهة التقييم بمنع النموذج من 'الاطلاع' على الأسئلة.

سابقًا، استخدم الشركاء الخارجيون بروتوكولات عدم التسجيل وضمانات تعاقدية للحفاظ على سرية تلميحات الاختبار. إضافة ضمانات تقنية وتشفيرية خطوة كبيرة إلى الأمام. يحتاج صناع السياسات والباحثون والمؤسسات إلى معايير موثوقة تعكس بدقة القدرات والسلامة الحقيقية للنموذج.

الكيانات الرئيسية: الشركات: Google DeepMind، OpenMined، MLCommons | المواقع: سنغافورة