HeadlinesBriefing favicon HeadlinesBriefing.com

Evaluasi AI Buta Ganda

Google DeepMind Blog •
×

Hasil benchmark AI dapat menjadi bias jika model melihat pertanyaan tes sebelumnya, masalah yang dikenal sebagai kontaminasi benchmark. Untuk mengatasi ini, Google DeepMind sedang menguji coba evaluasi buta ganda pertama di dunia terhadap model frontier kepemilikan. Pendekatan ini menjaga evaluasi eksternal dalam 'kotak' kriptografi sehingga tidak dapat digunakan untuk mengoptimalkan kinerja sebelum pengujian.

Google bermitra dengan Singapore AI Safety Institute, OpenMined, AVERI, dan MLCommons untuk menguji model Gemini Flash Lite terhadap benchmark rahasia dalam lingkungan yang menjaga privasi. Ini meningkatkan integritas evaluasi dengan mencegah model 'mengintip' pertanyaan.

Sebelumnya, mitra eksternal menggunakan protokol tanpa pencatatan dan perlindungan kontraktual untuk menjaga kerahasiaan prompt tes. Menambahkan perlindungan teknis dan kriptografi adalah langkah maju yang besar. Pembuat kebijakan, peneliti, dan perusahaan membutuhkan benchmark yang dapat dipercaya untuk secara akurat mencerminkan kemampuan dan keamanan sebenarnya dari sebuah model.

Entitas Kunci: Perusahaan: Google DeepMind, OpenMined, MLCommons | Lokasi: Singapura