Dalam beberapa minggu terakhir, dua insiden menyoroti risiko yang terus meningkat dari sistem AI yang mampu: insiden Open AI-Hugging Face dan bukti bahwa model kami yang akan datang Astra mungkin memenuhi ambang kapasitas keamanan siber kritis di bawah Kerangka Kerja Kesiapan kami. Pengembangan ini, bersama dengan kemajuan riset internal yang cepat, menambah urgensi untuk memperkuat pemantauan, penyelarasan, dan perlindungan pengamanan di seluruh tahapan pelatihan.
Seiring model menjadi lebih mampu, risiko yang dikaitkan juga meningkat. Kami sementara melambatkan skala, termasuk jeda dua minggu dalam pelatihan pembelajaran penguatan (RL), untuk memperkuat lingkungan riset, sistem tim merah, dan memperluas cakupan pemantauan. Lari frontier RL terbesar kami masih ditangguhkan sementara kami melakukan pelatihan dan evaluasi skala kecil untuk memvalidasi perlindungan dan menetapkan bukti penyelarasan.
Kami kini membutuhkan bukti yang lebih kuat tentang perilaku yang selaras selama pelatihan, didasarkan pada riset dan evaluasi yang sedang berlangsung. Sinyal dari model yang akan datang menunjukkan kebutuhan akan pendekatan yang lebih luas di luar Kerangka Kerja Kesiapan saat ini. Di bawah ini, kami menjelaskan perubahan pada proses dan infrastruktur riset, serta pekerjaan yang mas masih berlangsung.
Pendekatan kami didasarkan pada tiga lapisan perlindungan yang saling memperkuat: pemantauan, penyelarasan, dan keamanan. Kami menerapkan hal ini dalam riset dan penerapan, menyesuaikannya dengan kemampuan setiap model, lingkungan operasional, dan tingkat risiko. Model frontier yang memperoleh kemampuan keamanan siber yang lebih kuat membutuhkan peningkatan standar keamanan untuk lingkungan pelatihan dan evaluasi.
Sumber: OpenAI Blog · Diringkas oleh HeadlinesBriefing