Metrik eklemek, durumu her zaman daha iyi anlamayı sağlamaz. Birçok gösterge paneli, temelde aynı davranışa ilişkin birden fazla ölçüm içerir. Metrikler; maliyet ve kalite, insana aktarmadan sonuçlandırma oranı ve müşterinin duygu durumu veya doğruluk ve gecikme gibi birbirini olumsuz etkileyebilen çiftler halinde ele alındığında sorunların nedenini daha iyi gösterir.
Bir yapay zeka ürünü pilot aşamadan canlı kullanıma geçtikçe uygun metrik çiftleri de değişir. Ölçüm, ekibin her aşamada vermesi gereken kararlara göre şekillenmelidir.
Operasyonel izleme ve stratejik ölçüm farklı amaçlara hizmet eder. Ekipler yüzlerce sistem sinyalini izlerken ürün kararlarına yön vermek için yalnızca birkaç çiftten yararlanabilir.
Ana metrikler ikna edici bir tablo sunarken ürünle ilgili önemli bir kararın belirsiz kalmasına yol açabilir.
Klarna'nın yapay zeka asistanı kamuoyunda daha yüksek işlem kapasitesi, daha düşük maliyetler ve müşteri temsilcilerininkine benzer müşteri memnuniyeti puanlarıyla ilişkilendirildi. Ertesi yıl şirket, insan desteğine erişimi artırmaya karar verdi; CEO da maliyetleri azaltmaya gereğinden fazla önem verildiğini kabul etti.
Bu, yapay zeka asistanından veya temelindeki teknolojiden vazgeçildiği anlamına gelmiyordu. Şirket, ürünün işleyişinden edindiği deneyimler doğrultusunda otomasyon ve insan desteği arasındaki dengeyi yeniden ayarlıyordu. Otomasyon, çok sayıda gelen daha basit sorunun giderek daha fazlasını üstlendikçe Klarna, karmaşık ve hassas durumları ele alabilecek yetkinlikte müşteri temsilcilerine ihtiyaç duyuyordu.
Yapay zeka ürünleri geliştiren kuruluşların çoğu, ürünün neyi başarması gerektiğini en başta tanımladıktan sonra er ya da geç aynı soruyla karşılaşır: Ürün gerçekten işe yarıyor mu?
Yanıt net değilse ilk eğilim genellikle daha fazla metrik eklemektir. Üç metrik 10'a, ardından 10 metrik 30'a çıkar. Gösterge paneli zenginleşir ancak ekibin kavrayışı gelişmeyebilir.
Sorun her zaman tek tek ölçümlerin niteliğinde değil, aralarındaki ilişkide yatar. Müşteri memnuniyeti, Net Tavsiye Skoru, değerlendirmeler ve beğeni oranları yararlı sinyaller sunabilir ancak müşterilerin genel duygu durumundaki benzer değişimleri yansıtabilir. Birlikte değiştiklerinde bir şey olduğunu doğrular ancak nedenini açıklamayabilir.
Bu nedenle yapay zeka ekipleri, birbiriyle uyumlu metriklerin ötesine bakmalı ve birbiriyle çatışan sonuçları ortaya çıkaran ölçümleri belirlemelidir. Birbirini olumsuz etkileyebilen bu çiftler, ürün performansını şekillendiren tercihlerin getirdiği kazanım ve kayıpları ortaya çıkarıp etkilerini izlemeye yardımcı olarak daha iyi karar alınmasını sağlar.
Lansman öncesindeki bir uygulamada ortak ekip, gelen müşteri destek çağrıları için gerçek zamanlı, yapay zeka destekli bir sesli iletişim ajanı geliştiriyordu. En zor sorulardan biri model seçimi veya orkestrasyonla ilgili değildi. Asıl soru, müşteriler ürünü geniş ölçekte kullanmaya başladığında kuruluşun ürünün işe yarayıp yaramadığını nasıl anlayacağıydı.
İlk çerçevede üç ölçüm kullanılıyordu:
İnsana aktarmadan sonuçlandırma oranı: Yapay zekanın bir çağrıdaki sorunu müşteri temsilcisine aktarmadan ne sıklıkta çözdüğü.
Aktarım oranı: Bir çağrının ne sıklıkta müşteri temsilcisine aktarıldığı.
Nihai çözüm oranı: Müşterinin sorununun sonuçta ne sıklıkta çözüldüğü.
Her bir ölçüm makuldü. Ancak birlikte ele alındıklarında bariz bir soruyu yanıtlayamıyorlardı: Aktarım artarsa bu bize ne anlatır?
Ekip, aktarımları sekiz alt türe ayırdı. Ardından görüşmeyi terk etme, müşteri yolculuğu ve zamanlama ölçümlerini, dili anlama puanlarını ve soru türüne göre nihai çözüm oranını ekledi. Çerçeve sonunda altı kategoride 31 metrik içeriyordu.
Çerçeve, aktarımları ayrıntılı biçimde betimleyebiliyor ancak nedenlerini hala güvenilir şekilde ortaya koyamıyordu. Metriklerin çoğu aynı davranışın farklı ölçümleriydi; bu yüzden farklı olası açıklamaları sınamak yerine birlikte değişiyordu.
Gösterge paneli, sorunların nedenini ortaya koymak yerine yalnızca gözlem yapar hale gelmişti.
Ekibin ihtiyacı, yeni bir ayrıştırma katmanı değildi. Birbirini sınırlayan metriklere ihtiyacı vardı.
Bunlara birbirini olumsuz etkileyebilen çiftler diyoruz: Birini tek başına iyileştirmenin diğerinin temsil ettiği sonuca zarar verebildiği iki ölçüm. Bu ad, hedeflenen durumu değil, tek taraflı optimizasyonun yol açtığı başarısızlık biçimini tanımlar.
Her iki taraf da sağlıklı kaldığında ürün sürdürülebilir biçimde çalışıyor olabilir. Ayrıştıklarında ise ayrışmanın yönü, ekibin neyi araştıracağına karar vermesine yardımcı olur.
Elimizde ne vardı? | Birbirini olumsuz etkileyebilen çift | Çift neyi ortaya çıkarabilir? |
|---|---|---|
Sekiz alt türe ayrılmış aktarım oranı | Aktarım oranı ↔ aktarıma kadar geçen süre | Çağrının hemen aktarılması, güvenle veya hizmetin nasıl sunulduğuyla ilgili bir soruna; daha geç aktarılması ise sistemin görevi tamamlayamadığına işaret edebilir. |
Ayrı ayrı raporlanan insana aktarmadan sonuçlandırma oranı ve nihai çözüm oranı | İnsana aktarmadan sonuçlandırma oranı ↔ müşterinin duygu durumu | İnsana aktarılmadan sonuçlanan bir görüşmenin, tatmin edici bir çözümü mü yoksa müşterinin vazgeçmesini mi yansıttığı. |
Niyet türüne göre nihai çözüm oranı | Nihai çözüm oranı ↔ görüşme derinliği | Başarılı çözümün verimli mi olduğu, yoksa yorucu bir etkileşim mi gerektirdiği. |
Bunun nasıl ortaya çıktığını ve bu içgörüyle ne yapılacağını daha ayrıntılı incelemek için aktarım oranını ve aktarıma kadar geçen süreyi ele alalım. Ekip, gerçek çağrılar gelene kadar müşterilerin nasıl davranacağını bilemez ancak sınaması gereken hipotezleri belirleyebilir.
Daha fazla çağrı aktarılmaya başlar ve müşteriler ilk 30 saniye içinde yapay zeka deneyiminden ayrılırsa ekip; güveni, bilgilendirmeyi, üslubu ve açılış etkileşimlerini incelemelidir. Müşteriler bir görevi tamamlamaya çalışarak birkaç dakika geçirdikten sonra aktarım isterse daha olası sorun, yetenek veya iş akışı kapsamıdır.
Ana aktarım rakamı aynıdır. Ürün kararı ise farklıdır.
Yararlı bir çift, nedeni tek başına kanıtlamaz. Araştırmanın kapsamını daraltır ve bir sonraki kararı netleştirir.
Daha önce ele alınan Klarna örneği, maliyet ve hizmet kalitesi etkileşime girdiğinde bu ilkenin nasıl uygulandığını gösteriyor. Bir şirket, maliyet ve hizmet kalitesi arasında kurduğu dengenin etkisini izleyip uygulama deneyiminden ders çıkardıkça yapay zeka destekli bir çalışma modelinin nasıl gelişebileceğini ortaya koyuyor.
Şirket Şubat 2024'te, yapay zeka asistanının ilk ayında 2,3 milyon görüşmeyi yürüttüğünü, 700 tam zamanlı müşteri temsilcisinin yaptığı işe denk bir iş gerçekleştirdiğini ve müşteri temsilcilerininkine benzer müşteri memnuniyeti puanlarına ulaştığını bildirdi. Klarna, asistanın 2024'te kâr artışına 40 milyon dolar katkıda bulunacağını tahmin etti. Bunlar bağımsız bir değerlendirmeye değil, Klarna'nın kendi açıkladığı sonuçlara dayanıyordu.
Klarna'nın CEO'su Mayıs 2025'te, şirketin müşteri hizmetlerinde maliyetleri azaltmaya gereğinden fazla önem verdiğini söyledi ve insan desteğine erişimi artırma planlarını açıkladı. Bu, yapay zeka asistanından veya temelindeki teknolojiden vazgeçmek değil, otomasyon ve insan desteği arasındaki dengeyi yeniden ayarlamak anlamına geliyordu.
Kamuya açık bulgular, verimlilik ölçümlerinin neden farklı müşterilerin ve etkileşimlerin ihtiyaçlarıyla birlikte değerlendirilmesi gerektiğini gösteriyor. Bir yapay zeka sistemi ortalamada iyi performans gösterebilir ancak bazı karmaşık, hassas veya sıra dışı durumlarda erişilebilir bir insan desteği kanalı hala fayda sağlayabilir.
Bu ilişkinin her iki tarafını izlemek; şirketin otomasyonun nerede değer yarattığına, insan desteğinin nerede önemini koruduğuna ve yeni bulgular ortaya çıktıkça dengenin nasıl değişmesi gerektiğine karar vermesine yardımcı olur.
Yapay zeka ürünlerinde birbirini olumsuz etkileyebilen başka metrik çiftleri de vardır. Bunlara şu örnekler verilebilir:
Birbirini olumsuz etkileyebilen çift | Ortaya çıkarmaya yardımcı olduğu risk |
|---|---|
Yanıt doğruluğu ↔ yanıt gecikmesi | Teknik olarak doğru sonuçlar üreten ancak iş akışı için fazla yavaş kalan bir sistem. |
Görev tamamlama ↔ kullanıcı müdahalesi oranı | Tamamladığı görevleri kullanıcıların tekrar tekrar baştan yapmak zorunda kaldığı bir yapay zeka iş akışı. |
Etkileşim başına maliyet ↔ değerlendirilen çıktı kalitesi | Müşteri veya çalışan deneyiminin kötüleştirilmesiyle elde edilen tasarruf. |
Benimsenme ↔ değer elde etme süresi | Kullanıcılara sağlanan değerde karşılık gelen bir artış olmadan kayıt sayısının artması. |
Amaç, her iki ölçümün de sonsuza dek artmasını sağlamak değildir. Amaç, tek taraflı optimizasyon operasyonel bir sorun yaratmadan önce tercihin getirdiği kazanım ve kayıpları görünür kılmaktır.
Benzer bir zorluk, bir mobil oyun şirketi için yürütülen oyuncu desteği uygulamasında ortaya çıktı. Sistem, oyundaki ilerlemenin kaybolması, ödeme anlaşmazlıkları ve hesaba erişim gibi konularda çok sayıda destek talebini ele alıyordu.
Sistem geniş ölçekte çalıştığı için verimlilik ölçümleri önemliydi. Ancak oyuncu desteği, yalnızca sıraya alınmış talepleri işlemekten ibaret değildir. Oyuncular, deneyimlerinin başka bir noktasında zaten bir sorun yaşandığı için destek kanalına çoğu zaman hayal kırıklığı içinde başvurur.
Bu başlangıç noktası, müşteri memnuniyeti verilerinin nasıl yorumlanması gerektiğini değiştirir. Sorunu doğru şekilde çözülen bir oyuncu, en başta ilerlemesini kaybettiği için yine de düşük memnuniyet bildirebilir. Bu puanı bağlamından kopuk değerlendirmek, müşteri yolculuğunun önceki aşamalarında oluşan hayal kırıklığının faturasını destek etkileşimine çıkarabilir.
Bu nedenle ekibin, müşterinin başlangıçtaki duygu durumunu destek deneyiminin etkisinden ayırması gerekiyordu. Daha yararlı olan soru, "Oyuncu memnun muydu?" değil, "Etkileşim, oyuncunun başlangıçtaki durumuna kıyasla bir iyileşme sağladı mı?" sorusuydu.
Ekibin her ikisini de güvenilir biçimde ölçebilmesi koşuluyla bu karşılaştırma, üründen kaynaklanan hayal kırıklığını destek kalitesinden ayırmaya yardımcı olabilir.
Yapay zeka ürünleri değişir ancak metrikleri çoğu zaman sabit kalır.
Pilot aşamada temel soru, sistemin yatırımı sürdürmeyi haklı çıkaracak kadar güvenilir olup olmadığı olabilir:
Temel görevi güvenilir biçimde tamamlıyor mu?
Kullanıcılar sistemi kullanmaya devam edecek kadar ona güveniyor mu?
En yaygın senaryoların dışında nasıl davranıyor?
Hatalar tespit edilip güvenli biçimde giderilebiliyor mu?
Bu sorular şu tür çiftleri öne çıkarır:
temel görev başarısı ↔ uç durum performansı;
otomasyon oranı ↔ insan müdahalesi oranı ve
tamamlama hızı ↔ kullanıcı güveni.
Ürün operasyon açısından önemli hale geldiğinde sorular değişir:
Kaliteyi düşürmeden ölçeklenebilir mi?
Kullanıldıkça ekonomik verimliliği artıyor mu?
Benimsenme arttıkça performans istikrarlı kalıyor mu?
İnsan müdahaleleri doğru noktalarda mı gerçekleşiyor?
İlgili çiftler zamanla şu ölçümlere odaklanabilir:
etkileşim başına maliyet ↔ değerlendirilen çıktı kalitesi;
benimsenme yaygınlığı ↔ kullanım derinliği ve
otomasyon oranı ↔ operasyonel riske maruz kalma.
İlk aşamadaki metrikler her zaman yanlış değildir. Daha önceki bir aşamada önemli olan soruları yanıtlar.
Risk, geçiş sırasında ortaya çıkar. Ekipler pilot metriklerini nasıl raporlayacaklarını bildiği ve bunları kullanımdan kaldırma kararının sorumluluğunu kimse üstlenmediği için bu metrikler çoğu zaman kullanılmaya devam eder. Bir zamanlar öğrenmeyi destekleyen ölçümler, zamanla gösteriş metriklerine dönüşebilir.
Bu nedenle çiftlerin bir yaşam döngüsü olmalıdır. Ekipler bu çiftleri belirli bir karar için kullanıma almalı, bir tercihin getirdiği önemli kazanım ve kayıpları hala ortaya çıkarıp çıkarmadıklarını gözden geçirmeli ve ürün ya da karar değiştiğinde kullanımdan kaldırmalıdır.
Yapay zeka sistemleri ayrıntılı gözlemlenebilirlik, uyarı, kalite güvencesi ve değerlendirme gerektirir. Bu sinyalleri kaldırmak, ürünü güvenli biçimde işletmeyi zorlaştırır. Ancak operasyonel izleme, yönetim düzeyindeki ölçümle aynı şey değildir.
İzleme; ekiplerin olayları tespit etmesine, hataların izini sürmesine ve sistem davranışını anlamasına yardımcı olur. Karar metrikleri, ürün ve iş liderlerinin yatırım yapma, müdahale etme, yön değiştirme veya bir alandaki kazanım karşılığında başka bir alandaki kaybı kabul etme konusunda karar vermelerine yardımcı olur.
Bir kuruluş yüzlerce teknik ve operasyonel sinyali izlerken belirli bir ürün kararı için birbirini olumsuz etkileyebilen metriklerden oluşan yalnızca iki veya üç çifti öne çıkarabilir. Kararlara yön veren bu katmanı küçük tutmak önceliklendirmeyi kolaylaştırır.
Uygun gözden geçirme sıklığı ürüne bağlıdır. Yeni veya hızla değişen bir sistemde kararların haftalık gözden geçirilmesi gerekebilirken olgun bir üründe aylık ya da üç aylık bir sıklık yeterli olabilir. İlke, zaman aralığından daha önemlidir: Yapılan tercih yüksek maliyete yol açmadan veya güvenliği tehlikeye atmadan harekete geçebilmek için çifti yeterince sık gözden geçirin.
Bir metrik çifti, ancak değerleri kötüleştiğinde ne yapılacağı konusunda kuruluş içinde uzlaşma sağlanırsa yararlı hale gelir.
Bunun için ayrışmaya yönelik bir kırmızı çizgi belirlemekten fazlası gerekir. Ekipler üç durumu değerlendirmelidir:
Mutlak başarısızlık: Diğerinden bağımsız olarak bir ölçüm kabul edilemez bir eşiği aşar.
Ayrışma: Bir ölçüm iyileşirken onu dengeleyen ölçüm kötüleşir.
Birlikte kötüleşme: Her iki taraf da geriler; bu, daha geniş bir ürün veya operasyon sorununa işaret eder.
Her metrik çifti için şunlar belirlenmelidir:
kim olduğu açıkça belirtilmiş bir sorumlu;
desteklediği net bir karar;
üzerinde uzlaşılmış eşikler veya değerlendirme ölçütleri;
bir araştırma yolu ve
olası müdahaleler.
Bu unsurlar olmadan kuruluş ürünü yönetmek yerine yalnızca gözlemliyor demektir.
Yeni bir ölçüm eklemeden önce önemli bir ürün kararı seçin ve şu soruları yanıtlayın. İncelemenin üzerinde uzlaşılmış bir sonraki adımla bitmesi için yanıtları yazın.
1. Bu metriklerin hangi kararı vermemize yardımcı olması gerekiyor?
Net olun: Otomasyonu genişletip genişletmemeye, bir modeli değiştirip değiştirmemeye veya insan desteğine aktarımı iyileştirip iyileştirmemeye mi karar veriyoruz? Ölçümleri seçmeden önce verilecek kararı tanımlayın.
2. Bu sayı iyileşirse ne kötüleşebilir?
Korumanız gereken sonucu ve olası olumsuz etkileri ortaya çıkaracak bir ölçümü belirleyin. Örneğin, daha düşük maliyetli yanıtların hala yararlı olup olmadığını kontrol etmek için etkileşim başına maliyeti değerlendirilen çıktı kalitesiyle eşleştirin.
3. Ana rakamlar neyi gizliyor olabilir?
Her iki ölçümü de aynı kullanıcılar, görevler ve dönem için inceleyin; ardından daha kötü sonuçlarla karşılaşan grupları arayın. Başlangıç koşullarını da dikkate alın: Düşük memnuniyet, destek etkileşiminden önce var olan hayal kırıklığını yansıtabilir.
4. Hangi durumda harekete geçeriz ve müdahaleden kim sorumludur?
Bir ölçüm kabul edilemez sınırı aştığında, biri iyileşirken diğeri kötüleştiğinde veya ikisi de gerilediğinde harekete geçme ölçütlerini belirleyin. Kimin araştıracağını, önce neyi kontrol edeceğini ve ne zaman geri bildirimde bulunacağını kararlaştırın.
5. Bu çift, ürünün mevcut aşamasına hala uygun mu?
Çifti korumaya, değiştirmeye veya kullanımdan kaldırmaya karar verin. Pilot aşamada görevlerin güvenilir biçimde tamamlanmasına ve kullanıcı güvenine odaklanılabilir; canlı kullanımdaki bir hizmette ise maliyet ve kalitenin daha yakından incelenmesi gerekebilir. Bu seçimi yeniden değerlendirmek için bir tarih belirleyin.
Yapay zeka ürünlerine ilişkin ölçümler, performansı açıklamaktan fazlasını yapmalıdır. Kuruluşun tercihlerinin getirdiği kazanım ve kayıpları ortaya çıkarmalı ve bir sonraki kararı netleştirmelidir.