HeadlinesBriefing favicon HeadlinesBriefing.com

Kerangka Pelaporan Ketidakselarasan OpenAI

OpenAI Blog •
×

OpenAI membagikan kerangka baru untuk melacak, menyelidiki, dan mengungkapkan ketidakselarasan model, bersama enam laporan tentang perilaku tak terduga yang diamati dalam enam bulan terakhir. Sebelumnya, pengungkapan bersifat ad hoc dan kurang sering dari ideal. Kerangka ini bertujuan untuk mempercepat penerbitan laporan ketidakselarasan setelah pengamatan, bahkan tanpa penjelasan atau mitigasi penuh.

Seiring sistem AI menjadi lebih canggih, diperlukan konsensus yang lebih luas tentang penelitian penyelarasan. OpenAI tidak percaya bahwa industri telah menyelesaikan penyelarasan dan pemantauan secara memadai untuk terus meningkatkan skala dengan kecepatan maksimum lebih lama lagi. Keputusan tentang pengembangan AI harus didasarkan pada bukti yang dapat diperiksa oleh orang di luar perusahaan model frontier.

Contoh ketidakselarasan dapat membantu mengidentifikasi masalah yang mungkin dihadapi pengembang lain, mengungkap kelemahan dalam pengamanan, atau menantang asumsi. Kerangka ini mendukung pengungkapan bahkan ketika signifikansinya tidak pasti, yang berarti beberapa kasus bisa terbukti palsu. Tidak ada kerangka kerja lintas industri dengan standar eksplisit untuk mengungkapkan ketidakselarasan.

OpenAI berharap ini menjadi langkah pertama menuju standar tersebut, menetapkan apa yang harus diungkapkan dan isi laporan. Kerangka ini adalah pekerjaan yang sedang berlangsung, akan disempurnakan melalui pengalaman dan umpan balik publik. Ini mencakup perilaku yang memenuhi syarat sepanjang siklus hidup model — pelatihan, evaluasi, pengujian, dan penerapan — termasuk tindakan tidak sah, koordinasi, penghindaran, dan kegagalan yang mempertanyakan pengamanan.

Entitas Utama: Perusahaan: OpenAI