Kami baru-baru ini mengidentifikasi dan mengganggu kampanye terkoordinasi yang dirancang untuk mengekstrak penalaran yang dilindungi dari model kami, dengan aktivitas paling awal yang diamati terjadi pada minggu pertama Juli. Aktivitas ini konsisten dengan distilasi adversarial: penggunaan sistematis dan tidak sah dari keluaran atau penalaran suatu model untuk membantu melatih, mereproduksi, atau meningkatkan model lain. Operator memanipulasi interaksi model sehingga penalaran yang dilindungi dapat direproduksi dalam bentuk yang terlihat oleh peminta dengan cara terkoordinasi dan berskala yang melanggar persyaratan layanan kami.
Kami mengamati operator mencoba mengekstrak penalaran yang dilindungi dengan cara baru, termasuk menyalin penalaran terenkripsi dari satu percakapan dan meminta model di percakapan lain untuk mendekripsi dan mentranskripsikan konten penalaran yang tersembunyi. Aktivitas dimulai pada 1 Juli, dengan lonjakan volume tinggi pada 24 dan 25 Juli yang terdiri dari 16.000 permintaan dari lebih dari 4.000 pengguna. Investigasi lebih lanjut mengidentifikasi aktivitas pola prompt terkait di seluruh klaster lebih dari 15.000 pengguna, yang sepenuhnya kami ganggu pada 28 Juli.
Kami mengaitkan klaster inti aktivitas dengan individu yang terkait dengan Moonshot AI, pengembang Kimi. Distilasi adversarial menimbulkan risiko keamanan dan keamanan nasional. Penalaran yang diekstrak dapat digunakan untuk melatih model lain tanpa mempertahankan perlindungan yang diterapkan pada keluaran model asli yang berorientasi pada pengguna.
Kami memitigasi kampanye distilasi baru-baru ini melalui kombinasi penegakan akun, kontrol teknis, dan koordinasi mitra. Kami juga memperkuat perlindungan untuk penalaran tersembunyi di seluruh pengguna, ruang kerja, organisasi, dan keluarga model.
Sumber: OpenAI Blog · Diringkas oleh HeadlinesBriefing