• Teknologi

Mengapa Dukungan AI bagi Pilot Terhambat oleh Masalah Kepercayaan, Bukan Kemampuan

  • Felix Rose-Collins
  • 4 min read

Pendahuluan

Sebagian besar perusahaan yang menguji AI untuk layanan pelanggan menghadapi kendala yang sama. Sistem tersebut berjalan lancar selama beberapa minggu. Namun, kemudian sistem tersebut memberikan jawaban yang terdengar meyakinkan namun sepenuhnya salah kepada seorang pelanggan. Mungkin terkait batas waktu pengembalian dana. Atau mungkin mengenai kebijakan yang berubah pada kuartal lalu. Seorang petinggi menyadarinya, dan peluncuran sistem yang semula direncanakan untuk menangani sebagian besar antrean pelanggan pun terhenti diam-diam pada sebagian kecil dari antrean tersebut.

Data industri mendukung betapa umum pola ini terjadi. Laporan Kualitas Dunia 2025 dari OpenText, Capgemini, dan Sogeti menemukan bahwa masalah keandalan dan "halusinasi" menjadi hambatan utama dalam adopsi AI bagi 60% organisasi yang disurvei. Penelitian terpisah dari Gong menunjukkan 58% perusahaan telah menunda proyek AI, dan hampir setengah dari investasi AI yang direncanakan terhambat oleh masalah kepercayaan, bukan anggaran. Alat-alatnya sudah mumpuni. Yang tertinggal hanyalah kepercayaan terhadapnya.

Perhitungan di Balik Satu Jawaban yang Salah

Pekerjaan dukungan bersifat asimetris sehingga tidak menguntungkan jika menggunakan akurasi rata-rata sebagai metrik. Jawaban yang benar menghemat beberapa menit. Jawaban yang salah bisa menyetujui pengembalian dana yang seharusnya tidak pernah dikeluarkan, menciptakan kebijakan yang tidak pernah ada, atau membuat komitmen yang tidak pernah disetujui. Ketika kerugian dari satu kesalahan melebihi manfaat dari seratus jawaban yang benar, mengoptimalkan untuk kasus rata-rata adalah tujuan yang sepenuhnya salah.

Ada juga biaya tersembunyi. Seorang pemimpin tim dukungan yang sekali saja mendapati AI salah akan mulai memeriksa ulang segalanya setelah itu, yang menghilangkan sebagian besar waktu yang seharusnya dihemat. Kepercayaan tidak dinilai per percakapan. Kepercayaan terbangun atau runtuh, dan begitu runtuh, tim akan berhenti mempercayai sistem bahkan ketika sistem tersebut benar sebagian besar waktu.

Halusinasi Tidak Hilang, Melainkan Dikelola

Bahkan model bahasa terkuat pun dapat menghasilkan informasi yang tidak akurat dalam kondisi tertentu, dan angka sebenarnya lebih tinggi daripada yang diasumsikan kebanyakan orang. Pada ringkasan berbasis teks (grounded summarization)—yang pada dasarnya sama dengan menjawab pertanyaan berdasarkan dokumen bantuan sendiri—papan peringkat halusinasi Vectara menempatkan model terbaik sekitar 3% dan menunjukkan model andalan yang terkenal berkisar antara 6% hingga 15%. Beberapa model yang mengandalkan penalaran intensif bahkan melampaui 20% pada tugas yang sama, karena penalaran yang lebih mendalam memberi mereka ruang lebih luas untuk mengemukakan klaim yang tidak pernah disebutkan dalam teks sumber. Jika model dipaksa menjawab pertanyaan terbuka tanpa acuan yang jelas, angkanya menjadi jauh lebih buruk. Peneliti Stanford menemukan bahwa model-model terkemuka mengalami halusinasi pada mayoritas besar pertanyaan hukum spesifik ketika tidak ada dokumen sumber yang disediakan.

Hal ini tidak berarti bahwa model tertentu itu buruk. Artinya, tidak ada satu pun model, jika digunakan sendiri, yang cukup andal untuk dihadirkan di hadapan pelanggan yang membayar tanpa pengawasan.

Kecerdasan dan Pengendalian Berlawanan Arah

Ada alasan struktural mengapa satu model saja tidak dapat menyelesaikan masalah ini sendiri. Semakin baik suatu sistem dalam menangani kasus-kasus yang ambigu atau tidak dikenal, semakin sulit pula untuk memprediksinya sepenuhnya, karena penalaran yang sama yang memungkinkannya menangani kasus yang tidak pernah diskenariokan oleh siapa pun adalah penalaran yang kadang-kadang membawanya ke arah yang tidak seharusnya. Model yang lebih mumpuni tidak otomatis menjadi model yang lebih aman. Pertukaran ini adalah alasan mengapa keandalan harus dirancang sebagai lapisan di sekitar model, bukan diharapkan dari model itu sendiri.

Aissist menangani hal ini dengan empat teknik berlapis, bukan hanya satu. Rekayasa prompt menetapkan aturan dasar yang diikuti setiap tugas, yang lebih penting dalam sistem agen di mana satu permintaan pelanggan dapat berkembang menjadi lebih dari selusin subtugas yang semuanya harus mematuhi batasan yang sama. Langkah "booster" menjalankan keputusan yang tidak pasti lebih dari sekali dan mempertahankan jawaban yang disetujui oleh sebagian besar agen, dengan biaya komputasi tambahan. Tahap "self inspection" membuat sistem meninjau keluaran sendiri, atau menyerahkannya ke model kedua dengan peran berbeda, sebelum apa pun sampai ke pelanggan. Dan lapisan tata kelola bertumpuk berada di atas semuanya, memeriksa apakah keluaran atau tindakan sesuai dengan kebijakan sebelum dikeluarkan, berfungsi lebih sebagai pengawas sistem secara keseluruhan daripada sekadar filter.

Kombinasi itulah yang membuat platform ini mampu menjaga tingkat kesalahan AI-nya di bawah 1%, angka yang patut diperhatikan terutama karena sangat sedikit vendor di bidang ini yang mempublikasikannya.

Menilai Kapan Tidak Harus Menjawab

Perilaku paling berharga dari seorang agen dukungan bukanlah menjawab lebih banyak pertanyaan dengan benar. Melainkan mengenali pertanyaan mana yang tidak seharusnya dijawab sendiri. Sistem yang segera mengeskalasi sengketa penagihan yang rumit, lengkap dengan konteksnya, akan menimbulkan kerusakan jauh lebih sedikit daripada sistem yang terus memaksakan diri dan menebak-nebak. Inilah juga yang membedakan agen yang sekadar menjelaskan solusi dengan agen yang benar-benar menerapkannya, yaitu dengan membuka pesanan, melakukan perubahan, dan mengonfirmasikannya kembali kepada pelanggan.

Keandalan Harus Dipelihara, Bukan Hanya Dibangun

Sistem yang akurat pada hari peluncuran tidak akan tetap demikian tanpa ada yang memantaunya. Produk berubah, kebijakan diperbarui, dan pertanyaan yang diajukan pelanggan pun ikut berubah seiring dengan itu. Pengukuran berkelanjutan menangkap perubahan tersebut sebagai data, bukan sebagai gelombang keluhan, dan siklus evaluasi, pengujian, dan peluncuran yang disiplin terus menutup celah yang ditemukan, dengan campur tangan manusia yang tetap memberikan persetujuan sebelum perubahan apa pun benar-benar diterapkan.

Apa yang Sebenarnya Harus Diperiksa Sebelum Mempercayai Sebuah Vendor

Setiap penyedia layanan yang mengklaim bahwa AI mereka tidak pernah melakukan kesalahan harus ditanggapi dengan skeptis, karena hal itu biasanya berarti tidak ada yang mengukurnya dengan cukup cermat untuk mengetahui sebaliknya. Penyedia layanan yang layak diperhatikan akan mempublikasikan tingkat kesalahan, menjelaskan secara tepat bagaimana mereka mendeteksi kesalahan sebelum pelanggan melihatnya, dan terbuka mengenai kapan sistem akan menyerahkan penanganan kepada manusia alih-alih hanya menebak. Itu adalah pendekatan yang sangat berbeda dari “percayalah pada AI,” dan itulah yang benar-benar terbukti efektif ketika volume tiket yang sesungguhnya mulai membanjiri sistem.

Felix Rose-Collins

Felix Rose-Collins

Ranktracker's CEO/CMO & Co-founder

Felix Rose-Collins is the Co-founder and CEO/CMO of Ranktracker. With over 15 years of SEO experience, he has single-handedly scaled the Ranktracker site to over 500,000 monthly visits, with 390,000 of these stemming from organic searches each month.

Mulai gunakan Ranktracker... Gratis!

Cari tahu apa yang menghambat situs web Anda untuk mendapatkan peringkat.

Buat akun gratis

Atau Masuk menggunakan kredensial Anda

Different views of Ranktracker app