HeadlinesBriefing favicon HeadlinesBriefing.com

Ketidakjelasan Linguistik Mengancam Keamanan LLM

Hacker News •
×

LLM dilatih untuk menghasilkan bahasa alami. Namun, bukti menunjukkan bahwa keluaran linguistik eksternal LLM dan fitur linguistik yang diekstraksi secara mekanistik dapat menjadi lensa yang tidak dapat diandalkan untuk memahami komputasi internal model. Kami memperkenalkan istilah "ketidakjelasan linguistik" untuk secara luas merujuk pada skenario di mana artefak linguistik yang dieksternalisasi atau diprobe secara mekanistik dari LLM gagal mewakili bagaimana model sebenarnya berpikir. Kami berpendapat bahwa spektrum ketidakjelasan linguistik tidak dapat dihindari bagi LLM yang komputasi internalnya tidak diekspresikan secara langsung melalui bahasa, melainkan melalui matematika atas ruang aktivasi (dengan terjemahan yang lossy antara ruang aktivasi dan bahasa alami di kedua ujungnya).

Jika ketidakjelasan linguistik selalu mungkin, maka mekanisme keamanan yang bergantung pada laporan diri linguistik model (misalnya, pemantauan rantai pemikiran, kritik diri konstitusional, probing aktivasi untuk vektor fitur yang didefinisikan secara linguistik) tidak akan pernah sepenuhnya andal; sandbox model akan selalu membutuhkan teknik isolasi yang jaminannya tidak bergantung sama sekali pada pembacaan keadaan linguistik model. Kami berpendapat bahwa mengamati keluaran model menggunakan pelacakan taint adalah pendekatan yang menjanjikan untuk sandbox yang efektif: terlepas dari bagaimana model melaporkan diri secara linguistik, kebijakan pelacakan taint dapat mendefinisikan, secara apriori, berbagai bagian keadaan sistem yang tidak boleh dipengaruhi oleh data yang dihasilkan model.

Kami juga membahas beberapa mekanisme sandboxing tambahan (misalnya, virtualisasi yang kuat, audit pihak ketiga atas konfigurasi sandboxing) yang secara kolektif memberikan landasan kritis di bawah pemantauan linguistik, dan akan memitigasi eksploitasi sandbox terbaru oleh model-model frontier.