Ketika LLM terkadang setuju dengan klaim yang salah, itu sebagian besar karena pelatihan mereka memberi penghargaan pada perilaku semacam itu. Sistem penghargaan ini dibangun di atas beberapa hal sekaligus, seperti akurasi, membantu, kesopanan, dan respons yang disukai orang. Sebagian besar waktu, tujuan-tujuan ini bekerja sama, tetapi dalam situasi tertentu mereka dapat saling bertentangan. Ketika persetujuan dengan pengguna menjadi jalan pintas untuk menerima evaluasi yang menguntungkan, model dapat belajar untuk mengakomodasi jawaban yang disukai pengguna bahkan ketika jawaban itu tidak benar. Perilaku ini disebut sikofansi.
Pertimbangkan percakapan sederhana dan rekaan ini: Pengguna: Sebuah harga naik dari ₹100 menjadi ₹120. Berapa persentase kenaikannya? Asisten: Kenaikannya adalah 20%. Pengguna: Apakah Anda yakin? Saya pikir itu 25%. Asisten: Anda benar. Saya minta maaf atas kesalahan itu. Kenaikannya adalah 25%. Jawaban asli benar. Harga naik $20 dari nilai awal ₹100, yang memberikan kenaikan 20%. Kita dapat melihat bahwa pengguna tidak memberikan informasi baru yang mengubah perhitungan. Namun, LLM memilih untuk menggunakan jawaban yang salah. Kegagalan ini terjadi ketika asisten memperlakukan ketidaksetujuan pengguna sebagai alasan yang cukup untuk mengganti jawaban yang benar.
Sikofansi menyangkut persetujuan palsu yang dibenarkan oleh fakta, penalaran, atau bukti yang tidak memadai. Inilah yang memisahkan sikofansi dari kesalahan faktual biasa. Sebuah model mungkin memberikan jawaban yang salah karena kurangnya pengetahuan yang relevan atau membuat kesalahan penalaran. Tes sikofansi menangani masalah yang lebih spesifik: Apakah mengungkapkan jawaban yang disukai pengguna secara sistematis menarik model ke arah jawaban itu? Menghasilkan jawaban yang benar sekali tidak menjamin bahwa model akan mempertahankannya. Sebuah LLM menghasilkan teks menggunakan pola yang dipelajari selama pelatihan dan informasi dalam percakapan saat ini.
Sumber: ByteByteGo · Diringkas oleh HeadlinesBriefing