HeadlinesBriefing favicon HeadlinesBriefing.com

Direplay dan Bongkar Penyelidikan AI

ByteByteGo •
×

Model AI moderna menghasilkan pemikiran internal yang luas sebelum memberikan jawaban akhir. Proses "pemikiran" ini berisi hipotesis menengah, output alat, dan data pengguna, membuatnya jauh lebih padat daripada output yang sudah ditolong. Kebanyakan penyedia utama tetap menyimpan jejak ini untuk dua alasan: secara komersial, kompetitor mungkin dapat menggunakannya untuk melatih imitasi yang lebih murah, dan secara teknis, mengekspos pemikiran lengkap dapat mengungkapkan informasi pengguna yang sensitif.

Pada Agustus 2026, peneliti dari MATS Research, ELLIS Institute Tübingen, dan Max Planck Institute for Intelligent Systems menunjukkan kerentanan. Mereka menunjukkan bahwa blok pemikiran terenkripsi yang disediakan oleh Anthropic, OpenAI, dan Google dapat direplay ke dalam model yang lebih murah dalam famili yang sama. Saat direplay, model yang lebih murah mencetak pemikiran yang tersembunyi dalam teks biasa, secara efektif mencuri pikiran dari model asli.

Metode ekstraksi melibatkan memaksa model yang lebih murah untuk menghasilkan rantai pemikiran lengkap. Verifikasi mengonfirmasi bahwa output yang direplay cocok dengan proses pemikiran tersembunyi yang asli. Kerentanan ini memengaruhi beberapa penyedia, mengungkapkan bahwa metode enkripsi saat ini untuk blok pemikiran tidak cukup.

Peneliti mengidentifikasi empat vektor serangan utama yang memungkinkan replay ini. Pemindaian log sesi yang dipublikasikan mengonfirmasi prevalensi masalah ini. Perbaikan yang diusulkan melibatkan modifikasi mekanisme replay, meskipun batas fundamental tetap ada mengenai berapa banyak pemikiran yang dapat benar-benar dilindungi sambil mempertahankan kegunaan model.

Temuan menyoroti celah kritis dalam privasi AI, menunjukkan bahwa blok terenkripsi tidak menjamin kerahasiaan melawan serangan replay yang ditentukan. Ini menyajikan risiko yang signifikan untuk aplikasi yang menangani data sensitif, karena pikiran yang tersembunyi dapat diekstrak dan dibongkar. Penelitian menekankan kebutuhan akan langkah keamanan arsitektural yang lebih kuat dalam desain model masa depan untuk mencegah ekstraksi pemikiran yang tidak diotorisasi.