HeadlinesBriefing favicon HeadlinesBriefing.com

Chatbot AI salah 57% dalam jawaban keuangan

Financial Times Companies •
×

Penelitian dari perusahaan teknologi Saturn menunjukkan bahwa model AI populer dari Chat GPT, Claude, Copilot, Grok, dan Gemini memberikan jawaban yang salah untuk pertanyaan keuangan rata-rata 57% dari waktu. Untuk pertanyaan kompleks yang memerlukan beberapa perhitungan, tingkat kesalahan naik menjadi 88%, dengan beberapa model gagal 99% dari waktu. Penelitian ini menguji lebih dari 100 pertanyaan terkait uang pada 18 model AI, dengan total lebih dari 10.000 kueri.

Kesalahan termasuk kesalahan perhitungan, perubahan pajak yang dihilangkan, dan aturan yang dibuat-buat. Dalam satu kasus, Claude Haiku 4.5 memberikan panduan pajak pensiun yang salah yang berisiko denda £17.500 dari HMRC. Kesalahan lainnya melihat Claude menciptakan aturan yang memungkinkan penghentian pembayaran pinjaman mahasiswa saat pindah ke luar negeri.

Model berbayar lebih unggul dari model gratis, dan versi yang lebih baru lebih akurat. Pelaku terbaik, Claude Opus 5 dalam mode penalaran, masih melakukan kesalahan 39% dari waktu. Sarah Coles, kepala keuangan pribadi di AJ Bell, mengatakan bahwa penasihat semakin sering melihat klien bertindak berdasarkan saran AI yang membingungkan.

Meskipun chatbot dapat membantu dengan anggaran dan penelitian, Otoritas Perilaku Keuangan menemukan bahwa satu dari lima orang dewasa di Inggris terbuka untuk AI membuat keputusan keuangan, dengan investor muda sangat percaya. Amal Jolly dari Saturn memperingatkan bahwa saran keuangan AI tetap tidak diatur, meninggalkan konsumen tanpa perlindungan atau kompensasi yang tersedia dari penasihat manusia.