HeadlinesBriefing favicon HeadlinesBriefing.com

Merancang Guardrail Arsitektur untuk Agen AI

Towards Data Science •
×

Saya sedang membangun agen internal untuk meningkatkan pekerjaan, membutuhkan riset internet, akses sumber daya, dan eksekusi aseperti mengirim email. Ini menciptakan "trisula mematikan" dari risiko injeksi prompt. Simon Willison memperingatkan bahwa internet tidak dapat dipercaya; LLM tidak dapat membedakan antara prompt dan konteks.

Penyerang dapat mengubah agen melalui fragmen teks tersembunyi, seperti perintah untuk mengirim data ke alamat eksternal. Bahkan konten tidak sengaja, seperti halaman web kompetitor yang dirancang untuk mendukung satu solusi, dapat menipu LLM untuk peringkat tidak adil, yang disebut "injeksi prompt tidak langsung." Sejarah menunjukkan bahwa risiko ini nyata: Notebook LM bocor informasi pelanggan, ChatGPT Operator salin email pribadi dari Hacker News, dan Microsoft Copilot berikan link menipu dari situs penyerang. Tanggung jawab saya adalah membangung guardrail untuk mencegah serangan sengaja dan hasil tidak sengaja.

Desain agen safe dimulai dengan pemahaman sistem. Pertahanan level pengguna melibatkan daftar aksi yang mungkin dan implementasi autentikasi, verifikasi akses, dan pelatihan. Membatasi upload ke SharePoint internal dan menerapkan pelatihan keamanan mengurangi risiko konten tidak dipercaya.

Pertahanan level sistem adalah jalan paling efektif, menggunakan pola desain arsitektur untuk mengamankan agen terhadap celah dan hasil advers.