Model AI arus utama gagal menjawab dengan benar pada 57% pertanyaan keuangan pribadi, menurut perusahaan fintech Inggris, Saturn. Tingkat kegagalan meningkat hingga 88% pada pertanyaan yang lebih sulit dan multi-langkah.
Hasil ini muncul di tengah meningkatnya ketergantungan konsumen pada chatbot untuk menjawab pertanyaan seputar uang.
Pertanyaan Lebih Sulit Gagal Dijawab Hampir Semua Model
Penelitian ini menjalankan 121 pertanyaan ke dalam 18 model gratis dan berbayar, dari penyedia seperti ChatGPT, Gemini, Claude, dan Copilot. Setiap pertanyaan diulang hingga 5 kali, menghasilkan lebih dari 10.000 jawaban.
Penilaian menganggap sebuah jawaban sebagai kegagalan bila berisi kesalahan fakta, melewatkan poin penting, atau tidak menyertakan peringatan yang seharusnya.
Model gratis menjadi yang terburuk, karena gagal pada 63% jawaban dibandingkan dengan 49% untuk versi berbayar. Pada pertanyaan paling sulit, model gratis gagal hingga 93% dari waktu ujian.
Disponsori
Disponsori
Claude Opus 5 dalam mode penalaran memimpin di bidang ini. namun, model ini tetap gagal pada 39% jawaban. Kesalahannya termasuk perhitungan yang keliru, perubahan pajak yang terlewat, dan aturan yang sebenarnya tidak ada.
Salah satu jawaban terkait pajak pensiun bahkan bisa membuat penabung dikenakan biaya sebesar £17.500 oleh HM Revenue and Customs.
“Jutaan orang mempercayakan model AI untuk nasihat keuangan, namun mereka justru mendapat jawaban yang salah sehingga bisa merugikan,” papar Amal Jolly, CEO Saturn, .
Ikuti kami di X untuk memperoleh berita terbaru secara real-time
Kepercayaan pada Chatbot AI Tetap Meningkat
Di sisi lain, penggunaan chatbot AI kini semakin luas di berbagai pasar dan kelompok usia. Sebuah survei global dari EY terhadap 18.000 konsumen menemukan bahwa 49% telah memakai AI untuk membantu keputusan tabungan dan investasi mereka.
Regulator keuangan di Inggris melaporkan pada bulan Agustus bahwa empat dari lima investor pemula pernah memakai AI untuk membantu investasi mereka. Dari yang disurvei, 56% menyatakan mereka mempercayai alat tersebut, lebih tinggi daripada TV dan radio yang hanya 47%.
Sementara itu, riset yang sama menemukan 44% peserta survei keliru percaya bahwa informasi keuangan yang dihasilkan AI sudah diawasi regulator.
Sebuah survei dari PensionBee terhadap 1.000 orang dewasa AS menemukan hampir enam dari sepuluh responden akan bertindak berdasarkan saran keuangan tanpa mengecek ulang secara mandiri. Hampir satu dari empat mengaku chatbot pernah memberi informasi salah tentang keuangan pribadi mereka.
Jolly mengingatkan bahwa nasihat keuangan AI tidak diawasi regulator, sehingga konsumen tidak mendapat hak ganti rugi seperti saat memakai penasihat manusia. Ia mendesak FCA agar segera bertindak.

