Dodajanje metrik ne izboljša nujno razumevanja. Številne nadzorne plošče vsebujejo več meril istega temeljnega vedenja. Metrike so bolj diagnostične, če jih združimo v vzajemno škodljive pare: stroške s kakovostjo, samostojno razrešitev z razpoloženjem strank ali točnost z zakasnitvijo.
Ustrezni pari se spreminjajo, ko izdelek umetne inteligence preide iz pilotne faze v produkcijo. Merjenje naj sledi odločitvam, ki jih mora ekipa sprejeti v posamezni fazi.
Operativno spremljanje in strateško merjenje imata različna namena. Ekipe lahko spremljajo na stotine sistemskih signalov, pri produktnih odločitvah pa se opirajo le na nekaj parov.
Glavne metrike lahko podajo prepričljivo zgodbo, ne da bi razrešile pomembno produktno odločitev.
Klarninega pomočnika z umetno inteligenco so v javnosti povezovali z večjo prepustnostjo, nižjimi stroški in ocenami zadovoljstva strank, primerljivimi z ocenami človeških agentov. Naslednje leto se je podjetje odločilo razširiti dostop do človeške podpore, njegov izvršni direktor pa je priznal, da so zmanjševanju stroškov namenili preveč pozornosti.
To ni pomenilo zavrnitve pomočnika z umetno inteligenco ali tehnologije, na kateri je temeljil. Podjetje je na podlagi izkušenj z uporabo izdelka prilagodilo ravnovesje med avtomatizacijo in človeško podporo. Ko je avtomatizacija prevzemala vse več obsežnih, preprostejših poizvedb, so v podjetju Klarna potrebovali človeške agente, usposobljene za zapletene, občutljive primere.
Ko organizacije, ki razvijajo izdelke umetne inteligence, že na začetku opredelijo cilje izdelka, se bodo prej ali slej vprašale: ali dejansko deluje?
Če odgovor ni jasen, je prvi vzgib pogosto dodajanje novih metrik. Tri postanejo 10, nato jih iz 10 nastane 30. Nadzorna plošča je vse bogatejša, razumevanje ekipe pa se morda ne izboljša.
Težava ni vedno v kakovosti posameznih meril, temveč v njihovih medsebojnih razmerjih. Zadovoljstvo strank, indeks NPS, ocene in deleži všečkov lahko zagotovijo koristne signale, vendar utegnejo odražati podobne spremembe splošnega razpoloženja. Ko se spreminjajo skupaj, potrdijo, da se je nekaj zgodilo, ne pojasnijo pa nujno, zakaj.
Ekipe za umetno inteligenco naj zato presežejo metrike, ki se medsebojno potrjujejo, in poiščejo merila, ki razkrivajo nasprotujoče si rezultate. Ti vzajemno škodljivi pari razkrivajo kompromise, ki vplivajo na uspešnost izdelka, in pomagajo spremljati njihove posledice, kar omogoča boljše odločanje.
Pri eni od uvedb pred lansiranjem je skupna ekipa razvijala govornega agenta z umetno inteligenco v realnem času za dohodne klice podpore strankam. Eno najtežjih vprašanj ni zadevalo izbire modela ali orkestracije. Šlo je za to, kako bo organizacija vedela, ali izdelek deluje, ko ga bodo stranke začele množično uporabljati.
Začetni okvir je uporabljal tri merila:
Stopnja samostojne razrešitve: kako pogosto umetna inteligenca razreši klic, ne da bi ga predala človeku.
Stopnja predaje: kako pogosto je klic predan človeškemu agentu.
Stopnja razrešitve: kako pogosto je težava stranke na koncu razrešena.
Vsako merilo je bilo smiselno. Skupaj pa niso mogla odgovoriti na očitno vprašanje: kaj nam pove povečanje števila predaj?
Ekipa je predaje razčlenila na osem podvrst. Nato je dodala meritve opustitev, poti in časov, ocene razumevanja jezika ter stopnjo razrešitve glede na vrsto poizvedbe. Okvir je nazadnje vseboval 31 metrik v šestih kategorijah.
Predaje je lahko podrobno opisal, še vedno pa ni mogel zanesljivo ugotoviti njihovega vzroka. Večina metrik je merila različice istega vedenja, zato so se spreminjale skupaj, namesto da bi preverjale konkurenčne razlage.
Nadzorna plošča je postala opisna namesto diagnostična.
Ekipa ni potrebovala še ene ravni razčlenjevanja. Potrebovala je metrike, ki se medsebojno omejujejo.
Imenujemo jih vzajemno škodljivi pari: dve merili, pri katerih lahko izboljševanje enega brez upoštevanja drugega škoduje rezultatu, ki ga predstavlja drugo. Ime opisuje način odpovedi zaradi enostranske optimizacije, ne pa želenega stanja.
Ko obe strani ostajata zdravi, izdelek morda deluje vzdržno. Ko se začneta razhajati, smer razhajanja ekipi pomaga določiti, kaj naj razišče.
Kaj smo imeli | Vzajemno škodljiv par | Kaj lahko par razkrije |
|---|---|---|
Stopnja predaje, razdeljena na osem podvrst | Stopnja predaje ↔ čas do predaje | Takojšnja predaja lahko kaže na težavo z zaupanjem ali predstavitvijo; poznejša predaja pa na to, da sistem ne more dokončati naloge. |
Ločeno poročani stopnji samostojne razrešitve in razrešitve | Stopnja samostojne razrešitve ↔ razpoloženje strank | Ali samostojna razrešitev pomeni zadovoljivo rešitev ali pa je stranka opustila poskus. |
Stopnja razrešitve glede na vrsto namena | Stopnja razrešitve ↔ globina pogovora | Ali je uspešna razrešitev učinkovita ali zahteva izčrpavajočo interakcijo. |
Za podrobnejši pogled na to, kako se kompromis razkrije in kako uporabiti to spoznanje, si oglejmo stopnjo predaje in čas do predaje. Ekipa ne bo vedela, kako se stranke vedejo, dokler ne prispejo resnični klici, lahko pa opredeli hipoteze, ki jih mora preveriti.
Če se začne predajati več klicev in stranke v prvih 30 sekundah zapustijo izkušnjo z umetno inteligenco, naj ekipa razišče zaupanje, razkritje uporabe UI, ton in uvodne interakcije. Če stranke zahtevajo predajo po več minutah poskušanja izvedbe naloge, je verjetnejša težava v zmogljivostih ali pokritosti poteka dela.
Glavna vrednost stopnje predaje je enaka. Produktna odločitev pa je drugačna.
Koristen par sam po sebi ne dokazuje vzroka. Zoži obseg preiskave in pojasni naslednjo odločitev.
Prej predstavljeni primer Klarne kaže, kako se to načelo uporablja pri medsebojnem vplivu stroškov in kakovosti storitve. Kaže, kako se lahko operativni model, podprt z umetno inteligenco, razvija, ko podjetje spremlja posledice kompromisov in se uči iz uvedbe.
Februarja 2024 je podjetje poročalo, da je njegov pomočnik z umetno inteligenco v prvem mesecu opravil 2,3 milijona pogovorov, opravil delo 700 agentov s polnim delovnim časom in dosegel ocene zadovoljstva strank, primerljive z ocenami človeških agentov. Klarna je ocenila, da bo pomočnik v letu 2024 prispeval 40 milijonov USD k izboljšanju dobička. To so bili rezultati, o katerih je poročala Klarna sama, in ne neodvisna ocena.
Maja 2025 je izvršni direktor Klarne dejal, da je podjetje pri podpori strankam preveč poudarjalo zmanjševanje stroškov, in opisal načrte za razširitev dostopa do človeške podpore. To je pomenilo prilagoditev ravnovesja med avtomatizirano in človeško podporo, ne pa zavrnitve pomočnika z umetno inteligenco ali tehnologije, na kateri je temeljil.
Javno dostopni podatki kažejo, zakaj je treba merila učinkovitosti obravnavati skupaj s potrebami različnih strank in vrst interakcij. Sistem umetne inteligence je lahko v povprečju uspešen, vendar nekaterim zapletenim, občutljivim ali neobičajnim primerom še vedno koristi dostopen človeški kanal.
Spremljanje obeh strani tega razmerja podjetju pomaga določiti, kje avtomatizacija ustvarja vrednost, kje ostaja pomembna človeška podpora in kako naj se ravnovesje spreminja z novimi spoznanji.
Drugi vzajemno škodljivi pari pri izdelkih umetne inteligence lahko vključujejo:
Vzajemno škodljiv par | Tveganje, ki ga pomaga razkriti |
|---|---|
Točnost odgovora ↔ zakasnitev odgovora | Sistem, ki je tehnično točen, vendar prepočasen za potek dela. |
Dokončanje naloge ↔ stopnja razveljavitev uporabnika | Potek dela z umetno inteligenco, ki dokonča naloge, uporabniki pa jih nato vedno znova opravijo na novo. |
Strošek na interakcijo ↔ ocenjena kakovost rezultata | Prihranki, doseženi s poslabšanjem izkušnje strank ali zaposlenih. |
Sprejetje ↔ čas do ustvarjene vrednosti | Rast števila registracij brez ustrezne vrednosti za uporabnike. |
Namen ni, da obe merili neomejeno naraščata. Namen je razkriti kompromis, preden enostranska optimizacija povzroči operativno težavo.
S podoben izzivom so se srečali pri uvedbi podpore igralcem za podjetje, ki razvija mobilne igre. Sistem je obravnaval zelo pogoste težave, kot so izgubljen napredek, plačilni spori in dostop do računa.
Merila učinkovitosti so bila pomembna, ker je sistem deloval v velikem obsegu. Toda podpora igralcem ni zgolj operativna čakalna vrsta. Igralci pogosto pridejo nezadovoljni, ker je šlo že prej nekaj narobe pri njihovi uporabniški izkušnji.
To izhodišče spremeni način razlage podatkov o zadovoljstvu strank. Igralec, čigar težava je pravilno razrešena, lahko še vedno poroča o nizkem zadovoljstvu, ker je sploh izgubil napredek. Če to oceno obravnavamo brez konteksta, lahko interakcijo s podporo neupravičeno kaznujemo zaradi nezadovoljstva, ki je nastalo prej na poti stranke.
Ekipa je zato morala razlikovati med začetnim razpoloženjem stranke in učinkom izkušnje s podporo. Koristnejše vprašanje ni bilo: »Ali je bil igralec zadovoljen?« Temveč: »Ali je interakcija izboljšala stanje glede na igralčevo izhodišče?«
Ta primerjava lahko pomaga ločiti nezadovoljstvo z izdelkom od kakovosti podpore, če lahko ekipa zanesljivo meri oboje.
Izdelki umetne inteligence se spreminjajo, njihove metrike pa pogosto ostanejo enake.
Med pilotnim projektom je lahko osrednje vprašanje, ali je sistem dovolj zaupanja vreden, da upravičuje nadaljnje naložbe:
Ali zanesljivo dokonča osnovno nalogo?
Ali mu uporabniki dovolj zaupajo, da ga še naprej uporabljajo?
Kako se vede zunaj najpogostejših scenarijev?
Ali je mogoče napake prepoznati in jih varno odpraviti?
Ta vprašanja dajejo prednost parom, kot so:
uspešnost osnovne naloge ↔ delovanje v robnih primerih;
stopnja avtomatizacije ↔ stopnja človeških posegov; in
hitrost dokončanja ↔ zaupanje uporabnikov.
Ko izdelek postane operativno pomemben, se vprašanja spremenijo:
Ali se lahko razširi brez zmanjšanja kakovosti?
Ali se njegova ekonomika z uporabo izboljšuje?
Ali uspešnost ostaja stabilna z rastjo sprejetja?
Ali do človeških posegov prihaja na pravih mestih?
Ustrezni pari se lahko spremenijo v:
strošek na interakcijo ↔ ocenjena kakovost rezultata;
širina sprejetja ↔ globina uporabe; in
stopnja avtomatizacije ↔ izpostavljenost operativnim tveganjem.
Začetne metrike niso nujno napačne. Odgovarjajo na vprašanja, ki so bila pomembna v zgodnejši fazi.
Tveganje nastane med prehodom. Pilotne metrike pogosto ostanejo, ker jih ekipe znajo poročati, nihče pa ni odgovoren za odločitev o njihovi opustitvi. Merila, ki so nekoč podpirala učenje, lahko postopoma postanejo nečimrne metrike.
Zato naj imajo tudi pari svoj življenjski cikel. Ekipe naj jih uvedejo za opredeljeno odločitev, preverjajo, ali še vedno razkrivajo pomemben kompromis, in jih opustijo, ko se izdelek ali odločitev spremeni.
Sistemi umetne inteligence zahtevajo podrobno opazljivost, opozarjanje, zagotavljanje kakovosti in vrednotenje. Če bi te signale odstranili, bi bilo varno upravljanje izdelka težje. Toda operativno spremljanje ni enako merjenju za potrebe vodstva.
Spremljanje ekipam pomaga zaznavati incidente, slediti napakam in razumeti vedenje sistema. Metrike za odločanje vodjem izdelkov in poslovnim vodjem pomagajo odločiti, ali naj vlagajo, ukrepajo, spremenijo smer ali sprejmejo kompromis.
Organizacija lahko spremlja na stotine tehničnih in operativnih signalov, za posamezno produktno odločitev pa izpostavi le dva ali tri vzajemno škodljive pare. Majhno število metrik na ravni odločanja olajša določanje prednostnih nalog.
Primerna pogostost pregledov je odvisna od izdelka. Nov ali hitro spreminjajoč se sistem lahko zahteva tedenske preglede odločitev, pri zrelem izdelku pa lahko zadostujejo mesečni ali četrtletni pregledi. Načelo je pomembnejše od časovnega razmika: par pregledujte dovolj pogosto, da lahko ukrepate, preden kompromis postane drag ali nevaren.
Par postane uporaben šele, ko se organizacija dogovori, kaj se bo zgodilo, če se poslabša.
Za to ni dovolj določiti kritične meje razhajanja. Ekipe naj upoštevajo tri pogoje:
Absolutna odpoved: eno merilo preseže nesprejemljiv prag ne glede na drugo.
Razhajanje: eno merilo se izboljša, medtem ko se njegovo protiutežno merilo poslabša.
Skupno poslabšanje: obe strani se poslabšata, kar kaže na širšo težavo z izdelkom ali njegovim delovanjem.
Vsak par naj ima:
imenovanega odgovornega;
jasno odločitev, ki jo podpira;
dogovorjene pragove ali merila vrednotenja;
načrt preiskave; in
nabor možnih ukrepov.
Brez teh elementov organizacija izdelek zgolj opazuje, namesto da bi ga upravljala.
Preden dodate novo merilo, izberite eno pomembno produktno odločitev in odgovorite na ta vprašanja. Odgovore zapišite, da se pregled konča z dogovorjenim naslednjim korakom.
1. Pri kateri odločitvi naj nam pomagajo te metrike?
Bodite konkretni: se odločamo o razširitvi avtomatizacije, zamenjavi modela ali izboljšanju predaje človeku? Odločitev poimenujte, preden izberete merila.
2. Kaj bi se lahko poslabšalo, če se ta številka izboljša?
Opredelite rezultat, ki ga morate zaščititi, in merilo, ki bi razkrilo škodo. Strošek na interakcijo denimo združite z ocenjeno kakovostjo rezultata, da preverite, ali so cenejši odgovori še vedno uporabni.
3. Kaj bi lahko skrivale glavne številke?
Obe merili preučite za iste uporabnike, naloge in časovno obdobje, nato pa poiščite skupine s slabšimi rezultati. Upoštevajte tudi začetne okoliščine: nizko zadovoljstvo je lahko posledica nezadovoljstva, ki je obstajalo že pred stikom s podporo.
4. Kaj bi nas spodbudilo k ukrepanju in kdo je odgovoren za odziv?
Določite merila za ukrepanje, ko eno merilo preseže nesprejemljivo mejo, ko se eno izboljša in drugo poslabša ali ko se poslabšata obe. Dogovorite se, kdo bo raziskal težavo, kaj bo najprej preveril in kdaj bo poročal o ugotovitvah.
5. Ali ta par še ustreza trenutni fazi izdelka?
Odločite se, ali ga boste obdržali, zamenjali ali opustili. Pilotni projekt se lahko osredotoča na zanesljivost nalog in zaupanje uporabnikov, delujoča storitev pa lahko zahteva podrobnejši nadzor stroškov in kakovosti. Določite datum ponovnega pregleda izbire.
Merjenje izdelka umetne inteligence bi moralo presegati opisovanje uspešnosti. Razkriti bi moralo kompromise organizacije in pojasniti naslednjo odločitev.