Vairāk metriku ne vienmēr sniedz labāku izpratni. Daudzos informācijas paneļos ir vairāki viena un tā paša pamatā esošā uzvedības modeļa rādītāji. Metrikas kļūst noderīgākas diagnostikai, ja tās apvieno savstarpēji izslēdzošos pāros: izmaksas ar kvalitāti, pašapkalpošanās atrisinājumu ar noskaņojumu vai precizitāti ar aizkavi.
Īstie pāri mainās, mākslīgā intelekta produktam pārejot no pilotprojekta uz produkcijas vidi. Mērījumi jāpielāgo lēmumiem, kas komandai jāpieņem katrā posmā.
Operatīvajai uzraudzībai un stratēģiskajiem mērījumiem ir atšķirīgi mērķi. Komandas var izsekot simtiem sistēmas signālu, taču produktu lēmumu pieņemšanai izmantot tikai dažus pārus.
Galvenās metrikas var radīt pārliecinošu stāstu, vienlaikus neatrisinot būtisku ar produktu saistītu jautājumu.
Klarna MI asistents publiski tika saistīts ar lielāku caurlaidspēju, zemākām izmaksām un klientu apmierinātības rādītājiem, kas līdzinājās cilvēku aģentu rezultātiem. Nākamajā gadā uzņēmums nolēma paplašināt cilvēku sniegtā atbalsta pieejamību, un tā vadītājs atzina, ka izmaksu samazināšanai bija pievērsts pārāk daudz uzmanības.
Tas nebija MI asistenta vai tā pamatā esošās tehnoloģijas noraidījums. Tā bija automatizācijas un cilvēku sniegtā pakalpojuma līdzsvara pielāgošana, uzņēmumam mācoties no produkta lietošanas. Tā kā automatizēti tika apstrādāta arvien lielāka daļa no daudzajiem vienkāršākajiem klientu jautājumiem, uzņēmumam Klarna bija nepieciešami klientu apkalpošanas darbinieki, kuri spētu risināt sarežģītus un delikātus gadījumus.
Jau sākumā nosakot, kas produktam jāsasniedz, vairums organizāciju, kas izstrādā MI produktus, galu galā saskarsies ar vienu un to pašu jautājumu: vai tas tiešām darbojas?
Ja atbilde nav skaidra, bieži rodas vēlme pievienot vairāk metriku. Trīs kļūst par 10, bet 10 – par 30. Informācijas panelis kļūst bagātīgāks, taču komandas izpratne var neuzlaboties.
Problēma ne vienmēr ir atsevišķo rādītāju kvalitātē, bet gan to savstarpējās attiecībās. Klientu apmierinātība, neto ieteikšanas indekss, atsauksmes un pozitīvo vērtējumu īpatsvars var sniegt noderīgus signālus, taču tie var atspoguļot līdzīgas kopējā noskaņojuma pārmaiņas. Ja tie mainās vienlaikus, tie apstiprina, ka kaut kas ir noticis, taču ne vienmēr paskaidro, kāpēc.
Tāpēc MI komandām jāraugās tālāk par savstarpēji saskanīgām metrikām un jāatrod rādītāji, kas atklāj konkurējošus rezultātus. Šie savstarpēji izslēdzošie pāri atklāj kompromisu ietekmi uz produkta veiktspēju, palīdz to uzraudzīt un pieņemt labākus lēmumus.
Kādā ieviešanas projektā pirms palaišanas kopīgā komanda izstrādāja reāllaika MI balss aģentu ienākošajiem klientu atbalsta zvaniem. Viens no sarežģītākajiem jautājumiem nebija par modeļa izvēli vai procesu orķestrāciju. Jautājums bija, kā organizācija zinās, vai produkts darbojas, kad klienti sāks to plaši izmantot.
Sākotnējā sistēma izmantoja trīs rādītājus:
Pašapkalpošanās atrisinājumu īpatsvars: cik bieži MI atrisina zvanu, nenododot to cilvēkam.
Eskalācijas īpatsvars: cik bieži zvans tiek nodots cilvēkam aģentam.
Atrisināšanas īpatsvars: cik bieži klienta problēma galu galā tiek atrisināta.
Katrs rādītājs bija pamatots. Tomēr kopā tie nespēja atbildēt uz acīmredzamu jautājumu: ja eskalācija pieaug, ko tas mums liecina?
Komanda sadalīja eskalāciju astoņos apakštipos. Pēc tam tā pievienoja sarunu pārtraukšanas, klienta ceļa un laika rādītājus, valodas izpratnes vērtējumus un atrisināšanas īpatsvaru pēc vaicājuma veida. Galu galā sistēmā bija 31 metrika sešās kategorijās.
Tā varēja detalizēti aprakstīt eskalāciju, taču joprojām nevarēja droši noteikt tās cēloni. Vairums metriku bija viena un tā paša uzvedības modeļa variācijas, tāpēc tās mainījās kopā, nevis pārbaudīja konkurējošus skaidrojumus.
Informācijas panelis bija kļuvis novērojošs, nevis diagnosticējošs.
Komandai nevajadzēja vēl vienu detalizācijas slāni. Tai vajadzēja metrikas, kas savstarpēji ierobežo viena otru.
Mēs tos saucam par savstarpēji izslēdzošiem pāriem: tie ir divi rādītāji, no kuriem viena atsevišķa uzlabošana var kaitēt otra pārstāvētajam rezultātam. Nosaukums raksturo kļūmes veidu, ko rada vienpusēja optimizācija, nevis vēlamo stāvokli.
Ja abi rādītāji saglabājas veselīgā līmenī, produkts, iespējams, darbojas ilgtspējīgi. Ja tie sāk atšķirties, atšķirības virziens palīdz komandai izlemt, ko izpētīt.
Kas mums bija | Savstarpēji izslēdzošs pāris | Ko pāris var atklāt |
|---|---|---|
Eskalācijas īpatsvars, sadalīts astoņos apakštipos | Eskalācijas īpatsvars ↔ laiks līdz eskalācijai | Tūlītēja eskalācija var liecināt par uzticēšanās vai formulējuma problēmu; vēlāka eskalācija – ka sistēma nespēj pabeigt uzdevumu. |
Pašapkalpošanās atrisinājumu un kopējais atrisināšanas īpatsvars norādīts atsevišķi | Pašapkalpošanās atrisinājumu īpatsvars ↔ klientu noskaņojums | Vai pašapkalpošanās risinājums nozīmē apmierinošu iznākumu vai to, ka klients pārtrauca mēģinājumu. |
Atrisināšanas īpatsvars pēc nolūka veida | Atrisināšanas īpatsvars ↔ sarunas dziļums | Vai veiksmīgs risinājums ir efektīvs vai prasa nogurdinošu mijiedarbību. |
Lai dziļāk izprastu, kā tas tiek atklāts un kā šo atziņu izmantot, aplūkosim eskalācijas īpatsvaru un laiku līdz eskalācijai. Komanda nezinās, kā klienti rīkosies, līdz sāks saņemt reālus zvanus, taču tā var definēt pārbaudāmās hipotēzes.
Ja sāk eskalēt vairāk zvanu un klienti pamet MI apkalpošanu pirmajās 30 sekundēs, komandai jāizpēta uzticēšanās, informācijas atklāšana, tonis un sarunas sākums. Ja klienti eskalē pēc vairāku minūšu mēģinājumiem izpildīt uzdevumu, ticamāka problēma ir sistēmas iespējas vai darbplūsmas aptvērums.
Galvenais eskalācijas skaitlis ir vienāds. Taču produkta lēmums ir atšķirīgs.
Noderīgs pāris pats par sevi nepierāda cēloni. Tas sašaurina izmeklēšanu un padara nākamo lēmumu skaidrāku.
Iepriekš minētais Klarna piemērs parāda, kā šis princips darbojas, mijiedarbojoties izmaksām un pakalpojuma kvalitātei. Tas parāda, kā uzņēmums var pilnveidot MI iespējotu darbības modeli, uzraugot kompromisu ietekmi un mācoties no ieviešanas.
2024. gada februārī uzņēmums ziņoja, ka tā MI asistents pirmajā mēnesī apkalpojis 2,3 miljonus sarunu, paveicis 700 pilnas slodzes aģentu darbam līdzvērtīgu apjomu un sasniedzis cilvēku aģentiem pielīdzināmus klientu apmierinātības rādītājus. Klarna lēsa, ka 2024. gadā asistents palīdzēs palielināt peļņu par 40 miljoniem ASV dolāru. Tie bija pašas Klarna ziņotie rezultāti, nevis neatkarīgs novērtējums.
2025. gada maijā Klarna vadītājs sacīja, ka uzņēmums klientu apkalpošanā pārāk lielu uzmanību pievērsis izmaksu samazināšanai, un aprakstīja plānus paplašināt cilvēku sniegtā atbalsta pieejamību. Tas nozīmēja automatizēto un cilvēku sniegto pakalpojumu līdzsvara pielāgošanu, nevis atteikšanos no MI asistenta vai tā pamatā esošās tehnoloģijas.
Publiski pieejamie dati parāda, kāpēc efektivitātes rādītāji jāvērtē kopā ar dažādu klientu un mijiedarbību vajadzībām. MI sistēma kopumā var darboties labi, tomēr dažos sarežģītos, sensitīvos vai neierastos gadījumos joprojām noder viegli pieejama saziņa ar cilvēku.
Abu šīs attiecības pušu uzraudzība palīdz uzņēmumam izlemt, kur automatizācija rada vērtību, kur cilvēku atbalsts joprojām ir svarīgs un kā līdzsvars jāmaina, parādoties jauniem datiem.
Citi MI produktos izmantojami savstarpēji izslēdzoši pāri var būt:
Savstarpēji izslēdzošs pāris | Risks, ko tas palīdz atklāt |
|---|---|
Atbildes precizitāte ↔ atbildes aizkave | Sistēma, kas ir tehniski precīza, taču darbplūsmai pārāk lēna. |
Uzdevumu izpilde ↔ lietotāju veikto labojumu īpatsvars | MI darbplūsma izpilda uzdevumus, kurus lietotāji atkārtoti pārstrādā. |
Izmaksas par mijiedarbību ↔ novērtētā rezultāta kvalitāte | Ietaupījumi, kas panākti, pasliktinot klientu vai darbinieku pieredzi. |
Ieviešana ↔ laiks līdz vērtības gūšanai | Reģistrāciju skaita pieaugums bez atbilstoša ieguvuma lietotājiem. |
Mērķis nav panākt abu rādītāju nebeidzamu pieaugumu. Mērķis ir padarīt kompromisu redzamu, pirms vienpusēja optimizācija rada operacionālu problēmu.
Līdzīgs izaicinājums radās, ieviešot spēlētāju atbalsta risinājumu mobilo spēļu uzņēmumā. Sistēma apstrādāja bieži sastopamas problēmas, piemēram, zaudētu progresu, maksājumu strīdus un piekļuvi kontam.
Efektivitātes rādītāji bija svarīgi, jo sistēma darbojās lielā mērogā. Taču spēlētāju atbalsts nav tikai operacionāla pieprasījumu rinda. Spēlētāji bieži ierodas neapmierināti, jo viņu pieredzē kaut kas jau ir nogājis greizi.
Šī sākotnējā situācija maina klientu apmierinātības datu interpretāciju. Spēlētājs, kura problēma ir pareizi atrisināta, joprojām var norādīt zemu apmierinātību, jo vispirms zaudēja progresu. Vērtējot šo rezultātu bez konteksta, atbalsta mijiedarbību var nepamatoti vainot neapmierinātībā, kas radusies agrāk klienta ceļā.
Tāpēc komandai bija jānošķir klienta sākotnējais noskaņojums no atbalsta pieredzes ietekmes. Noderīgāks jautājums nebija: “Vai spēlētājs bija apmierināts?” Tas bija: “Vai mijiedarbība uzlaboja situāciju salīdzinājumā ar spēlētāja sākotnējo stāvokli?”
Šis salīdzinājums var palīdzēt nošķirt neapmierinātību ar produktu no atbalsta kvalitātes, ja komandai ir uzticams veids, kā izmērīt abus.
MI produkti mainās, taču to metrikas bieži paliek nemainīgas.
Pilotprojekta laikā galvenais jautājums var būt, vai sistēma ir pietiekami uzticama, lai attaisnotu turpmākus ieguldījumus:
Vai tā uzticami izpilda pamatuzdevumu?
Vai lietotāji tai uzticas pietiekami, lai turpinātu to izmantot?
Kā tā darbojas ārpus izplatītākajiem scenārijiem?
Vai kļūmes var identificēt un pēc tām droši atjaunot darbību?
Šiem jautājumiem piemērotāki ir tādi pāri kā:
pamatuzdevuma sekmīga izpilde ↔ veiktspēja nestandarta gadījumos;
automatizācijas īpatsvars ↔ cilvēku veiktas pārņemšanas īpatsvars; un
izpildes ātrums ↔ lietotāju pārliecība.
Kad produkts kļūst operacionāli nozīmīgs, jautājumi mainās:
Vai tā mērogošana nepasliktina kvalitāti?
Vai tā ekonomiskie rādītāji uzlabojas līdz ar lietošanu?
Vai veiktspēja saglabājas stabila, pieaugot ieviešanai?
Vai cilvēki iesaistās pareizajās vietās?
Attiecīgie pāri var mainīties uz šādiem:
izmaksas par mijiedarbību ↔ novērtētā rezultāta kvalitāte;
ieviešanas tvērums ↔ lietošanas dziļums; un
automatizācijas īpatsvars ↔ pakļautība operacionālajam riskam.
Agrīnās metrikas ne vienmēr ir nepareizas. Tās atbild uz jautājumiem, kas bija svarīgi agrākā posmā.
Risks rodas pārejas laikā. Pilotprojekta metrikas bieži saglabājas, jo komandas prot par tām ziņot un neviens nav atbildīgs par lēmumu pārtraukt to izmantošanu. Rādītāji, kas reiz palīdzēja mācīties, pakāpeniski var kļūt par tukšas izrādīšanās metrikām.
Tāpēc arī pāriem jābūt savam dzīves ciklam. Komandām tie jāievieš konkrēta lēmuma vajadzībām, jāpārskata, vai tie joprojām atklāj būtisku kompromisu, un jāatsakās no tiem, kad mainās produkts vai lēmums.
MI sistēmām nepieciešama detalizēta novērojamība, brīdinājumi, kvalitātes nodrošināšana un novērtēšana. Šo signālu noņemšana apgrūtinātu produkta drošu ekspluatāciju. Taču operatīvā uzraudzība nav tas pats, kas vadībai paredzēti mērījumi.
Uzraudzība palīdz komandām konstatēt incidentus, izsekot kļūmēm un izprast sistēmas darbību. Lēmumu metrikas palīdz produktu un uzņēmuma vadītājiem izlemt, vai ieguldīt, iejaukties, mainīt virzienu vai pieņemt kompromisu.
Organizācija var uzraudzīt simtiem tehnisku un operacionālu signālu, bet konkrētam produkta lēmumam izcelt tikai divus vai trīs savstarpēji izslēdzošus pārus. Neliels lēmumu pieņemšanas līmenis atvieglo prioritāšu noteikšanu.
Piemērotais pārskatīšanas biežums ir atkarīgs no produkta. Jaunai vai strauji mainīgai sistēmai lēmumi var būt jāpārskata ik nedēļu, bet nobriedušam produktam var pietikt ar mēneša vai ceturkšņa ritmu. Princips ir svarīgāks par intervālu: pārskati pāri pietiekami bieži, lai rīkotos, pirms kompromiss kļūst dārgs vai nedrošs.
Pāris kļūst noderīgs tikai tad, kad organizācija vienojas, kas notiks, ja tā rādītāji pasliktināsies.
Ar kritiskās atšķirības robežas noteikšanu vien nepietiek. Komandām jāapsver trīs nosacījumi:
Absolūta kļūme: viens rādītājs pārsniedz nepieņemamu robežvērtību neatkarīgi no otra.
Atšķiršanās: viens rādītājs uzlabojas, kamēr to līdzsvarojošais rādītājs pasliktinās.
Kopīga pasliktināšanās: abi rādītāji krītas, liecinot par plašāku produkta vai darbības problēmu.
Katram pārim nepieciešams:
norīkots atbildīgais;
skaidrs lēmums, ko tas palīdz pieņemt;
saskaņotas robežvērtības vai vērtēšanas kritēriji;
izmeklēšanas plāns; un
iespējamo pasākumu kopums.
Bez šiem elementiem organizācija produktu tikai novēro, nevis pārvalda.
Pirms pievieno vēl vienu rādītāju, izvēlies vienu svarīgu produkta lēmumu un secīgi atbildi uz šiem jautājumiem. Pieraksti atbildes, lai pārskatīšanas beigās būtu saskaņots nākamais solis.
1. Kādu lēmumu mums jāpieņem ar šo metriku palīdzību?
Esi konkrēts: vai tu lem par automatizācijas paplašināšanu, modeļa maiņu vai nodošanas cilvēkam uzlabošanu? Pirms rādītāju izvēles nosauc lēmumu.
2. Ja šis skaitlis uzlabojas, kas varētu pasliktināties?
Nosaki aizsargājamo rezultātu un rādītāju, kas atklātu kaitējumu. Piemēram, savieno izmaksas par mijiedarbību pārī ar novērtēto rezultāta kvalitāti, lai pārbaudītu, vai lētākas atbildes joprojām ir noderīgas.
3. Ko galvenie skaitļi varētu slēpt?
Analizē abus rādītājus tiem pašiem lietotājiem, uzdevumiem un laikposmam, pēc tam meklē grupas ar sliktākiem rezultātiem. Ņem vērā arī sākotnējos apstākļus: zema apmierinātība var atspoguļot neapmierinātību, kas radusies pirms atbalsta mijiedarbības.
4. Kas liktu mums rīkoties, un kurš atbild par reakciju?
Nosaki rīcības kritērijus gadījumiem, kad rādītājs pārsniedz nepieņemamu robežu, viens uzlabojas, bet otrs pasliktinās, vai pasliktinās abi. Vienojies, kurš veiks izmeklēšanu, ko pārbaudīs vispirms un kad ziņos par rezultātiem.
5. Vai šis pāris joprojām atbilst produkta pašreizējam posmam?
Izlem, vai to paturēt, aizstāt vai pārtraukt izmantot. Pilotprojektā uzmanību var pievērst uzdevumu uzticamībai un lietotāju pārliecībai, bet aktīvā pakalpojumā var būt rūpīgāk jāvērtē izmaksas un kvalitāte. Nosaki datumu, kad izvēli pārskatīsi.
MI produktu mērījumiem jāsniedz kas vairāk par veiktspējas aprakstu. Tiem jāatklāj organizācijas izvēlētie kompromisi un jāpadara skaidrāks nākamais lēmums.