Menambah metrik belum tentu meningkatkan pemahaman. Banyak dasbor memuat beberapa ukuran untuk perilaku mendasar yang sama. Metrik menjadi lebih diagnostik jika dipadukan sebagai pasangan yang saling merusak: biaya dengan kualitas, penanganan mandiri dengan sentimen, atau akurasi dengan latensi.
Pasangan yang tepat berubah seiring produk AI beralih dari tahap uji coba ke tahap produksi. Pengukuran harus mengikuti keputusan yang perlu dibuat tim pada setiap tahap.
Pemantauan operasional dan pengukuran strategis memiliki tujuan yang berbeda. Tim dapat melacak ratusan sinyal sistem, tetapi hanya menggunakan beberapa pasangan untuk memandu keputusan produk.
Metrik utama dapat menyajikan narasi yang meyakinkan, tetapi tetap menyisakan keputusan produk penting yang belum terjawab.
Asisten AI Klarna secara terbuka dikaitkan dengan throughput yang lebih tinggi, biaya lebih rendah, dan skor kepuasan pelanggan yang sebanding dengan agen manusia. Tahun berikutnya, perusahaan memutuskan untuk memperluas akses ke dukungan manusia. Kepala eksekutifnya mengakui bahwa pengurangan biaya terlalu ditekankan.
Ini bukanlah penolakan terhadap asisten AI atau teknologi yang mendasarinya. Ini merupakan penyesuaian keseimbangan antara otomatisasi dan layanan manusia setelah perusahaan belajar dari pengoperasian produk tersebut. Seiring otomatisasi menangani lebih banyak pertanyaan sederhana bervolume tinggi, agen manusia yang dibutuhkan Klarna adalah agen yang mampu menangani kasus kompleks dan sensitif.
Setelah sejak awal menetapkan sasaran produk, sebagian besar organisasi yang membangun produk AI pada akhirnya akan menghadapi pertanyaan yang sama: apakah produk itu benar-benar berfungsi?
Jika jawabannya tidak jelas, naluri yang umum adalah menambah lebih banyak metrik. Tiga menjadi 10, lalu 10 menjadi 30. Dasbor makin kaya, tetapi pemahaman tim belum tentu meningkat.
Masalahnya tidak selalu terletak pada kualitas setiap ukuran, tetapi pada hubungan di antaranya. Kepuasan pelanggan, Net Promoter Score, ulasan, dan tingkat tanda suka dapat memberikan sinyal berguna, tetapi semuanya mungkin mencerminkan perubahan serupa dalam sentimen keseluruhan. Ketika semuanya bergerak searah, metrik tersebut mengonfirmasi bahwa sesuatu telah terjadi tanpa menjelaskan alasannya.
Karena itu, tim AI harus melihat melampaui metrik yang saling menguatkan dan menemukan ukuran yang mengungkap hasil yang saling bersaing. Pasangan yang saling merusak ini mengungkap dan membantu memantau dampak kompromi di balik kinerja produk sehingga keputusan dapat dibuat dengan lebih baik.
Dalam salah satu implementasi prapeluncuran, tim gabungan sedang mengembangkan agen suara AI waktu nyata untuk panggilan masuk dukungan pelanggan. Salah satu pertanyaan tersulit bukanlah tentang pemilihan model atau orkestrasi. Pertanyaannya adalah bagaimana organisasi mengetahui apakah produk tersebut berfungsi setelah pelanggan mulai menggunakannya dalam skala besar.
Kerangka awal menggunakan tiga ukuran:
Tingkat penanganan mandiri: seberapa sering AI menyelesaikan panggilan tanpa mengalihkannya kepada manusia.
Tingkat eskalasi: seberapa sering panggilan dialihkan kepada agen manusia.
Tingkat penyelesaian: seberapa sering masalah pelanggan akhirnya terselesaikan.
Setiap ukuran tersebut masuk akal. Namun, secara keseluruhan ketiganya tidak dapat menjawab pertanyaan yang jelas: jika eskalasi meningkat, apa artinya bagi kita?
Tim menguraikan eskalasi menjadi delapan subjenis. Kemudian, tim menambahkan ukuran pengabaian, perjalanan, dan waktu; skor pemahaman bahasa; serta penyelesaian menurut jenis kueri. Kerangka tersebut akhirnya mencakup 31 metrik dalam enam kategori.
Kerangka itu dapat menjelaskan eskalasi secara terperinci, tetapi tetap tidak dapat mendiagnosis penyebabnya secara andal. Sebagian besar metrik merupakan variasi dari perilaku yang sama, sehingga semuanya bergerak searah alih-alih menguji penjelasan yang saling bersaing.
Dasbor tersebut menjadi alat observasi, bukan diagnosis.
Yang dibutuhkan tim bukanlah lapisan penguraian tambahan. Tim membutuhkan metrik yang saling membatasi.
Kami menyebutnya pasangan yang saling merusak: dua ukuran yang membuat peningkatan salah satunya secara terpisah dapat merusak hasil yang diwakili ukuran lainnya. Nama tersebut menggambarkan kegagalan akibat optimasi sepihak, bukan kondisi yang diinginkan.
Jika kedua sisi tetap sehat, produk mungkin beroperasi secara berkelanjutan. Ketika keduanya menyimpang, arah penyimpangan membantu tim menentukan hal yang perlu diselidiki.
Yang kami miliki | Pasangan yang saling merusak | Hal yang dapat diungkap pasangan tersebut |
|---|---|---|
Tingkat eskalasi yang dibagi menjadi delapan subjenis | Tingkat eskalasi ↔ waktu hingga eskalasi | Eskalasi langsung dapat menunjukkan masalah kepercayaan atau pembingkaian; eskalasi belakangan dapat menunjukkan bahwa sistem tidak mampu menyelesaikan tugas. |
Tingkat penanganan mandiri dan tingkat penyelesaian dilaporkan secara terpisah | Tingkat penanganan mandiri ↔ sentimen pelanggan | Apakah penanganan mandiri berarti masalah terselesaikan secara memuaskan atau pelanggan menghentikan upayanya. |
Tingkat penyelesaian menurut jenis maksud | Tingkat penyelesaian ↔ kedalaman percakapan | Apakah penyelesaian yang berhasil berlangsung efisien atau memerlukan interaksi yang melelahkan. |
Untuk melihat lebih dalam bagaimana hal ini terungkap dan cara memanfaatkan wawasan tersebut, mari pertimbangkan tingkat eskalasi dan waktu hingga eskalasi. Tim belum mengetahui perilaku pelanggan hingga panggilan nyata masuk, tetapi dapat menentukan hipotesis yang perlu diuji.
Jika semakin banyak panggilan dieskalasikan dan pelanggan meninggalkan pengalaman AI dalam 30 detik pertama, tim harus menyelidiki kepercayaan, keterbukaan informasi, nada, dan interaksi pembuka. Jika pelanggan melakukan eskalasi setelah mencoba menyelesaikan tugas selama beberapa menit, masalah yang lebih mungkin adalah kemampuan atau cakupan alur kerja.
Angka utama eskalasinya sama. Keputusan produknya berbeda.
Pasangan yang berguna tidak membuktikan penyebab dengan sendirinya. Pasangan itu mempersempit penyelidikan dan memperjelas keputusan berikutnya.
Contoh Klarna yang diperkenalkan sebelumnya menunjukkan penerapan prinsip ini ketika biaya dan kualitas layanan saling berinteraksi. Contoh tersebut menunjukkan bagaimana model operasional berbasis AI dapat berkembang saat perusahaan memantau dampak kompromi dan belajar dari implementasinya.
Pada Februari 2024, perusahaan melaporkan bahwa asisten AI-nya menangani 2,3 juta percakapan pada bulan pertama, melakukan pekerjaan setara 700 agen purnawaktu, dan meraih skor kepuasan pelanggan yang sebanding dengan agen manusia. Klarna memperkirakan bahwa asisten tersebut akan berkontribusi pada peningkatan laba sebesar $40 juta selama 2024. Hasil ini dilaporkan sendiri oleh Klarna, bukan berdasarkan evaluasi independen.
Pada Mei 2025, kepala eksekutif Klarna mengatakan bahwa perusahaan terlalu menekankan pengurangan biaya dalam layanan pelanggan dan menjelaskan rencana untuk memperluas akses ke dukungan manusia. Ini merupakan penyesuaian keseimbangan antara layanan otomatis dan manusia, bukan penolakan terhadap asisten AI atau teknologi yang mendasarinya.
Bukti publik tersebut menunjukkan mengapa ukuran efisiensi harus dipertimbangkan bersama kebutuhan berbagai pelanggan dan interaksi. Sistem AI dapat berkinerja baik secara rata-rata, sementara beberapa kasus yang rumit, sensitif, atau tidak biasa tetap lebih baik ditangani melalui saluran manusia yang mudah diakses.
Memantau kedua sisi hubungan tersebut membantu perusahaan menentukan di mana otomatisasi menciptakan nilai, di mana dukungan manusia tetap penting, dan bagaimana keseimbangannya perlu berubah saat muncul bukti baru.
Pasangan lain yang saling merusak di berbagai produk AI dapat mencakup:
Pasangan yang saling merusak | Risiko yang dibantu untuk diungkap |
|---|---|
Akurasi respons ↔ latensi respons | Sistem yang akurat secara teknis, tetapi terlalu lambat untuk alur kerja. |
Penyelesaian tugas ↔ tingkat pengambilalihan oleh pengguna | Alur kerja AI yang menyelesaikan tugas, tetapi berulang kali dikerjakan ulang oleh pengguna. |
Biaya per interaksi ↔ kualitas output yang dievaluasi | Penghematan yang dicapai dengan menurunkan kualitas pengalaman pelanggan atau karyawan. |
Adopsi ↔ waktu untuk memperoleh manfaat | Pertumbuhan jumlah pendaftaran tanpa peningkatan manfaat yang sepadan bagi pengguna. |
Tujuannya bukan membuat kedua ukuran terus meningkat tanpa batas. Tujuannya adalah memperlihatkan kompromi sebelum optimasi sepihak menimbulkan masalah operasional.
Tantangan terkait muncul dalam implementasi dukungan pemain untuk sebuah perusahaan gim seluler. Sistem menangani masalah bervolume tinggi seperti hilangnya progres, sengketa pembayaran, dan akses akun.
Ukuran efisiensi penting karena sistem beroperasi dalam skala besar. Namun, dukungan pemain bukan sekadar antrean operasional. Pemain sering datang dalam keadaan frustrasi karena sesuatu telah lebih dahulu bermasalah di bagian lain pengalaman mereka.
Kondisi awal tersebut mengubah cara data kepuasan pelanggan harus ditafsirkan. Pemain yang masalahnya diselesaikan dengan benar mungkin tetap memberikan penilaian kepuasan rendah karena sejak awal mereka telah kehilangan progres. Membaca skor tersebut tanpa konteks dapat menyalahkan interaksi dukungan atas frustrasi yang timbul lebih awal dalam perjalanan pelanggan.
Karena itu, tim perlu membedakan sentimen awal pelanggan dari dampak pengalaman dukungan. Pertanyaan yang lebih berguna bukanlah, “Apakah pemain merasa puas?”Melainkan, “Apakah interaksi tersebut memperbaiki keadaan dibandingkan dengan kondisi awal pemain?””
Perbandingan tersebut dapat membantu membedakan frustrasi terhadap produk dari kualitas dukungan, asalkan tim memiliki cara yang andal untuk mengukur keduanya.
Produk AI berubah, tetapi metriknya sering tetap sama.
Selama uji coba, pertanyaan utamanya mungkin apakah sistem cukup dapat dipercaya untuk membenarkan investasi lanjutan:
Apakah sistem menyelesaikan tugas inti secara andal?
Apakah pengguna cukup memercayainya untuk terus menggunakannya?
Bagaimana perilakunya di luar skenario yang paling umum?
Dapatkah kegagalan diidentifikasi dan dipulihkan dengan aman?
Pertanyaan tersebut mendukung pasangan seperti:
keberhasilan tugas inti ↔ kinerja pada kasus khusus;
tingkat otomatisasi ↔ tingkat pengambilalihan oleh manusia; dan
kecepatan penyelesaian ↔ keyakinan pengguna.
Setelah produk menjadi penting secara operasional, pertanyaannya berubah:
Dapatkah skalanya ditingkatkan tanpa menurunkan kualitas?
Apakah keekonomiannya membaik seiring penggunaan?
Apakah kinerjanya tetap stabil seiring meningkatnya adopsi?
Apakah intervensi manusia terjadi di tempat yang tepat?
Pasangan yang sesuai dapat bergeser menjadi:
biaya per interaksi ↔ kualitas output yang dievaluasi;
cakupan adopsi ↔ kedalaman penggunaan; dan
tingkat otomatisasi ↔ paparan risiko operasional.
Metrik tahap awal belum tentu keliru. Metrik tersebut menjawab pertanyaan yang penting pada tahap sebelumnya.
Risiko muncul selama masa transisi. Metrik uji coba sering dipertahankan karena tim tahu cara melaporkannya dan tidak ada pihak yang bertanggung jawab memutuskan penghentiannya. Ukuran yang sebelumnya mendukung pembelajaran dapat perlahan berubah menjadi metrik semu.
Karena itu, pasangan harus memiliki siklus hidup. Tim harus memperkenalkannya untuk keputusan tertentu, meninjau apakah pasangan itu masih mengungkap kompromi yang signifikan, dan menghentikannya ketika produk atau keputusan berubah.
Sistem AI memerlukan observabilitas, peringatan, penjaminan mutu, dan evaluasi yang terperinci. Menghapus sinyal tersebut akan membuat produk lebih sulit dioperasikan dengan aman. Namun, pemantauan operasional tidak sama dengan pengukuran untuk pimpinan.
Pemantauan membantu tim mendeteksi insiden, melacak kegagalan, dan memahami perilaku sistem. Metrik keputusan membantu pemimpin produk dan bisnis menentukan apakah perlu berinvestasi, melakukan intervensi, mengubah arah, atau menerima suatu kompromi.
Organisasi dapat memantau ratusan sinyal teknis dan operasional, tetapi hanya mengangkat dua atau tiga pasangan yang saling merusak untuk keputusan produk tertentu. Menjaga lapisan keputusan tetap ringkas memudahkan penentuan prioritas.
Frekuensi peninjauan yang tepat bergantung pada produknya. Sistem baru atau yang berubah cepat mungkin memerlukan tinjauan keputusan mingguan, sedangkan produk matang dapat ditinjau setiap bulan atau triwulan. Prinsipnya lebih penting daripada intervalnya: tinjau pasangan cukup sering agar tindakan dapat diambil sebelum kompromi menjadi mahal atau tidak aman.
Pasangan baru berguna ketika organisasi menyepakati tindakan yang akan diambil jika kondisinya memburuk.
Hal ini membutuhkan lebih dari sekadar menetapkan batas kritis penyimpangan. Tim harus mempertimbangkan tiga kondisi:
Kegagalan absolut: satu ukuran melewati ambang yang tidak dapat diterima, terlepas dari ukuran lainnya.
Penyimpangan: satu ukuran membaik sementara penyeimbangnya memburuk.
Penurunan bersama: kedua sisi memburuk, yang menunjukkan masalah produk atau operasional yang lebih luas.
Setiap pasangan harus memiliki:
penanggung jawab yang ditetapkan;
keputusan jelas yang didukungnya;
ambang atau kriteria evaluasi yang disepakati;
alur penyelidikan; dan
serangkaian kemungkinan intervensi.
Tanpa unsur tersebut, organisasi hanya mengamati produk, bukan mengelolanya.
Sebelum menambahkan ukuran lain, pilih satu keputusan produk yang penting dan bahas pertanyaan berikut. Tuliskan jawabannya agar tinjauan berakhir dengan langkah berikutnya yang disepakati.
1. Keputusan apa yang perlu dibantu oleh metrik ini?
Bersikaplah spesifik: apakah kita memutuskan untuk memperluas otomatisasi, mengganti model, atau memperbaiki serah terima kepada manusia? Tentukan keputusannya sebelum memilih ukuran.
2. Jika angka ini membaik, apa yang dapat memburuk?
Identifikasi hasil yang perlu dilindungi dan ukuran yang dapat mengungkap dampak buruk. Misalnya, pasangkan biaya per interaksi dengan kualitas output yang dievaluasi untuk memeriksa apakah jawaban yang lebih murah tetap berguna.
3. Apa yang mungkin disembunyikan oleh angka utama?
Baca kedua ukuran untuk pengguna, tugas, dan periode yang sama, lalu cari kelompok yang memperoleh hasil lebih buruk. Pertimbangkan juga kondisi awal: kepuasan rendah mungkin mencerminkan rasa frustrasi yang sudah ada sebelum interaksi dukungan.
4. Apa yang akan mendorong kita bertindak, dan siapa yang bertanggung jawab menanganinya?
Tetapkan kriteria tindakan ketika suatu ukuran melewati batas yang tidak dapat diterima, satu ukuran membaik sementara yang lain memburuk, atau keduanya menurun. Sepakati siapa yang akan menyelidiki, apa yang pertama kali diperiksa, dan kapan hasilnya akan dilaporkan.
5. Apakah pasangan ini masih sesuai dengan tahap produk saat ini?
Putuskan apakah pasangan itu akan dipertahankan, diganti, atau dihentikan. Uji coba dapat berfokus pada keandalan tugas dan keyakinan pengguna; layanan aktif mungkin memerlukan pengawasan biaya dan kualitas yang lebih ketat. Tetapkan tanggal untuk meninjau kembali pilihan tersebut.
Pengukuran produk AI harus lebih dari sekadar menggambarkan kinerja. Pengukuran harus mengungkap kompromi yang dibuat organisasi dan memperjelas keputusan berikutnya.