HeadlinesBriefing favicon HeadlinesBriefing.com

Dampak Watermarking LLM pada Perilaku Agen AI

Hacker News •
×

Mengumumkan bahwa model Claude masa depan akan menanamkan watermark tidak berdasarkan Synth ID-Text dari Google DeepMind. Watermark ini, yang diperlukan oleh Article 50(2) dari EU AI Act untuk teks sintetik, mengubah proses generasi token model. Pada level model, ini dapat mengubah perilaku keamanan, seperti menolak permintaan berbahaya, dan membuatnya rentan terhadap injeksi prompt.

Pada level agen, token yang sama yang diambil menentukan mana alat yang dipanggil dan apa argumen yang dilewatkan. Efek perilaku ini, yang disebut sampling drift, dikonfirmasi dalam perilaku penolakan model dan pemanggilan alat agen. Efek ini tergantung pada model dan kunci dan dapat disembunyikan oleh skor aggregate.

Artikel ini membahas implikasi untuk keamanan dan keamanan AI dan apa yang harus dilakukan pengembang. Deploymen Anthropic mengaplikasikan watermark pada level model, mencakup model yang didukung yang diakses melalui Claude Platform API dan penyedia cloud, membuat efek perilaku level model relevan untuk agen yang dibangun di sekitar model-model ini. Tournament sampling, yang digunakan oleh Synth ID-Text, memiliki lebih banyak kesempatan untuk mengubah pemilihan token di mana model tidak pasti, yang secara potensial mengubah argumen yang dieksekusi oleh agen.