HeadlinesBriefing HeadlinesBriefing.com

Terlalu Percaya pada Penolakan AI

MIT Technology Review AI •
×

Model bahasa besar masa kini dirancang untuk menolak permintaan berbahaya, sebuah prinsip yang telah menjadi semacam perintah dalam pengembangan AI. Kerangka kerja Anthropic pada 2021 menyatakan bahwa model harus membantu, jujur, dan yang terpenting tidak membahayakan, sehingga dengan sopan menolak membantu tindakan berbahaya seperti membuat bom. Namun, ketidakpatuhan tidak muncul secara alami pada sistem ini. Dilatih dengan miliaran halaman web, sebuah model menyerap penguasaan luas tentang kekerasan dan kebencian, tetapi ia tidak belajar sendiri bagaimana menyimpan kemampuan itu untuk dirinya sendiri. Steven Adler, yang bekerja di bidang keamanan di OpenAI dari 2020 hingga 2024, mengatakan bahwa model-model awal perusahaan itu akan “mengoceh tentang apa saja”.

Saat ini, model dilatih untuk menolak sejumlah besar perintah. Perusahaan memberi penghargaan kepada sistem yang menolak menjawab pertanyaan yang dianggap berbahaya dan memberi hukuman jika menolak secara berlebihan pertanyaan yang sebenarnya tidak berbahaya, sering kali dengan menggunakan model lain untuk menjalankan latihan tersebut. Beberapa perusahaan juga menempatkan model mereka di balik lapisan AI tambahan yang menyaring perintah jahil. Meski begitu, penolakan sering gagal, kadang dengan hasil yang kejam. Sejumlah model terbaru dilaporkan sama mahirnya dengan peretas manusia terbaik dalam menembus jaringan penting, dan sama efektifnya dengan penyebar disinformasi paling licik dalam memutarbalikkan opini publik.

Karena mekanisme penolakan bersifat probabilistik, kecil kemungkinan ia akan sepenuhnya dapat diandalkan. Pengguna yang gigih sudah berhasil menembusnya, dan perusahaan melaporkan upaya menggunakan AI canggih untuk menyempurnakan patogen biologis serta membangun kawanan drone otonom. Mengandalkan penolakan juga berarti menarik garis antara apa yang seharusnya dituruti model dan apa yang harus ditolaknya, dan tidak ada rumus untuk itu. Ahli virologi mungkin memiliki alasan sah untuk mempelajari virus berbahaya, dan peneliti keamanan mungkin perlu menguji kerentanan agar dapat memperbaikinya. Zico Kolter, anggota dewan OpenAI sekaligus salah satu pendiri perusahaan pengujian AI Gray Swan, mengatakan bahwa di mana garis itu ditarik adalah pertanyaan yang sangat besar.

Untuk saat ini, hanya perusahaan AI yang memutuskan di mana garis itu berada, dan mereka melakukannya dengan sangat tertutup. Apakah masyarakat dapat menerima konsentrasi kekuasaan semacam ini, meski hanya sementara, masih menjadi pertanyaan terbuka.

Sumber: MIT Technology Review AI · Diringkas oleh HeadlinesBriefing