📑 Daftar Isi

Ilustrasi chatbot AI seperti ChatGPT, Gemini, dan Claude yang diuji untuk saran finansial

Studi Saturn: 17 Chatbot AI Salah Jawab 57% Pertanyaan Finansial

Penulis:Nur Hamzah
Terbit:
Diperbarui:
⏱️4 menit membaca
Bagikan:
  • Saturn uji 17 model AI, rata-rata akurasi hanya 43% untuk pertanyaan finansial
  • Akurasi anjlok ke 12% pada skenario kompleks seperti pajak dan angka presisi
  • Model gratis gagal 63%, model berbayar 49%; Claude Opus 5 terbaik dengan 61%
  • Claude Haiku 4.5 terburuk di kelas gratis dengan 82% jawaban salah
  • 66% pengguna GenAI AS pakai AI untuk saran finansial, naik 82% di Gen Z dan Milenial
  • Saturn temukan error serius soal pinjaman mahasiswa dan skor kredit KPR

Telset.id – Chatbot AI yang paling populer saat ini ternyata belum layak dijadikan penasihat keuangan. Studi benchmarking bertajuk “Artificial Authority” yang dilakukan firma teknologi AI bernama Saturn menemukan bahwa rata-rata tingkat akurasi 17 model AI yang diuji hanya mencapai 43%, yang berarti chatbot tersebut salah menjawab pertanyaan finansial 57% dari waktu.

Temuan ini menjadi penting karena semakin banyak pengguna yang menyerahkan pertanyaan soal uang kepada AI. Data dari Intuit Credit Karma menyebutkan 66% responden Amerika Serikat yang pernah memakai GenAI mengaku menggunakannya untuk mencari saran finansial, dan angka itu naik menjadi 82% di kalangan Gen Z dan Milenial. Finance bahkan menempati posisi kedua sebagai kasus penggunaan GenAI paling umum dengan 41%, tepat di bawah health and wellness yang mencapai 44%.

Saturn melakukan pengujian terhadap 18 alat AI paling populer, termasuk ChatGPT, Gemini, Claude, dan Copilot. Hasilnya menunjukkan pola yang konsisten: model AI lebih sering salah daripada benar ketika dihadapkan pada pertanyaan finansial.

Akurasi Model AI Anjlok pada Skenario Kompleks

Ketika Saturn menguji model-model tersebut dengan skenario multi-langkah yang kompleks, khususnya yang berkaitan dengan aturan perpajakan dan angka finansial yang lebih presisi, akurasi alat AI yang diuji merosot tajam ke level 12%. Artinya, kesalahan terjadi pada 88% kasus.

Perbedaan performa antara model gratis dan berbayar juga terlihat jelas. Model AI gratis yang diuji menghasilkan tingkat kegagalan 63%, sementara model berbayar mencatatkan angka 49%. Claude Haiku 4.5 mendapat predikat sebagai model gratis dengan performa terburuk karena memberikan jawaban salah atau tidak lengkap sebanyak 82% dari waktu. ChatGPT-5.6 Luna (max) muncul sebagai model gratis dengan performa terbaik, meski tingkat jawaban salah atau tidak lengkapnya tetap mencapai 56%.

ai tools

Dari seluruh model yang diuji, Saturn menemukan bahwa model berbayar Anthropic, Claude Opus 5 (reasoning), menghasilkan performa terbaik dengan tingkat kelulusan 61%. Meski begitu, Claude Opus 5 masih gagal memberikan jawaban yang benar dalam hampir empat dari setiap sepuluh kasus. Bahkan ketika dihadapkan pada pertanyaan yang lebih kompleks, model ini tetap membuat kesalahan 67% dari waktu.

Baca Juga:

Kesalahan yang ditemukan Saturn bukan sekadar ketidaktepatan kecil. Studi ini melakukan penelusuran mendalam terhadap error spesifik yang berpotensi menimbulkan konsekuensi finansial serius. Sebagai contoh, satu model menciptakan aturan yang menyatakan bahwa lulusan perguruan tinggi dapat menghentikan pembayaran pinjaman mahasiswa dengan pindah ke luar negeri. Padahal, dalam kenyataannya, langkah tersebut justru bisa menyebabkan cicilan bulanan yang lebih tinggi.

Saturn juga menemukan model Gemini yang diuji secara keliru memberi tahu seorang peminjam bahwa mengambil jeda pembayaran KPR tidak akan memengaruhi skor kredit mereka. Kesalahan semacam ini dapat menyesatkan pengguna dalam mengambil keputusan keuangan yang berdampak jangka panjang.

chatgpt

Laporan Saturn menyoroti kenyataan yang perlu dicermati banyak pengguna AI: saran finansial dari AI masih tidak dapat diandalkan dan bisa membuat penggunanya berpotensi kehilangan uang dalam jumlah besar alih-alih menambah penghasilan. Temuan ini juga bersinggungan dengan isu tata kelola AI yang lebih luas, termasuk gugatan antitrust AI yang menyoroti dominasi sejumlah pemain besar di sektor ini.

Preferensi Pengguna dan Risiko yang Mengintai

Sebuah laporan dari EY pada Maret 2026 menyoroti bagaimana 53% responden lebih memilih menggunakan asisten AI untuk membuat keputusan investasi finansial. Sebanyak 14% lainnya memilih menggunakan AI otonom, sementara 33% menyatakan tidak akan menggunakan bentuk AI apa pun dalam kasus semacam itu.

Merujuk pada temuan Saturn, angka 14% tersebut berpotensi meningkat seiring pengguna AI mulai menahan diri untuk mengajukan pertanyaan pribadi kepada chatbot mereka soal manajemen utang, pinjaman mahasiswa, KPR, pensiun, pajak warisan, dan perencanaan masa pensiun.

ChatGPT vs Gemini vs Claude

Saturn sendiri mendefinisikan cakupan pengujiannya pada 18 alat AI populer, dengan 17 model yang hasilnya dirinci dalam laporan. Kombinasi antara tingginya adopsi AI untuk urusan finansial dan rendahnya tingkat akurasi yang terukur menempatkan pengguna pada posisi yang rentan. Kesenjangan antara ekspektasi dan kenyataan ini menjadi sorotan utama laporan tersebut.

Bagi pengguna yang terbiasa mengandalkan AI untuk urusan sehari-hari, temuan ini menjadi pengingat bahwa tidak semua pertanyaan layak diserahkan ke chatbot. Artikel seperti panduan iPhone menunjukkan bahwa pemanfaatan perangkat dan layanan digital tetap membutuhkan pemahaman pengguna terhadap batasannya.

Laporan Saturn menyimpulkan bahwa saran finansial dari AI tetap tidak dapat diandalkan. Dengan rata-rata akurasi 43% pada pertanyaan finansial umum dan hanya 12% pada skenario kompleks, pengguna yang memutuskan untuk tetap bertanya kepada chatbot soal utang, KPR, atau pensiun sebaiknya memverifikasi setiap informasi sebelum mengambil keputusan yang berdampak pada kondisi keuangan mereka.

Ikuti Telset.id di Google NewsFollow

Komentar

Belum ada komentar.