Mõõdikute lisamine ei paranda tingimata arusaamist. Paljudel töölaudadel on sama aluskäitumise kohta mitu mõõdikut. Mõõdikud aitavad probleeme paremini diagnoosida, kui need ühendada vastastikku kahjustavateks paarideks: kulu ja kvaliteet, iseteenindusmäär ja kliendi meelestatus või täpsus ja latentsus.
Õiged paarid muutuvad, kui AI-toode liigub katseprojektist tootmisse. Mõõtmine peaks lähtuma otsustest, mida meeskond peab igas etapis tegema.
Operatiivse seire ja strateegilise mõõtmise eesmärgid on erinevad. Meeskonnad võivad jälgida sadu süsteemisignaale, kuid kasutada tooteotsuste suunamiseks vaid mõnda mõõdikupaari.
Põhimõõdikud võivad jutustada veenva loo, kuid jätta olulise tooteotsuse lahenduseta.
Klarna AI-assistenti seostati avalikult suurema läbilaske, väiksemate kulude ja inimteenindajatega võrreldavate kliendirahulolu näitajatega. Järgmisel aastal otsustas ettevõte parandada inimtoe kättesaadavust ning tegevjuht tunnistas, et kulude vähendamisele oli pööratud liiga palju tähelepanu.
See ei olnud tehisintellektist assistendi ega selle aluseks oleva tehnoloogia tagasilükkamine. See oli automatiseerimise ja inimteeninduse vahelise tasakaalu kohandamine vastavalt sellele, mida ettevõte toote käigushoidmisest õppis. Kuna automatiseerimine võttis üle suurema osa suuremahulistest ja lihtsamatest päringutest, vajas Klarna inimteenindajaid, kes olid ettevalmistatud keerulisteks ja tundlikeks juhtumiteks.
Kui alguses on määratletud, mida toode peab saavutama, jõuab enamik AI-tooteid arendavaid organisatsioone lõpuks sama küsimuseni: kas see päriselt töötab?
Kui vastus pole selge, tekib sageli soov lisada veel mõõdikuid. Kolmest saab 10 ja seejärel 10-st 30. Töölaud muutub sisukamaks, kuid meeskonna arusaam ei pruugi paraneda.
Probleem ei seisne alati üksikute mõõdikute kvaliteedis, vaid nende omavahelises suhtes. Kliendirahulolu, soovitusindeks, arvustused ja positiivsete hinnangute osakaal võivad kõik anda kasulikke signaale, kuid kajastada üldise meelestatuse samu muutusi. Kui need liiguvad koos, kinnitavad need, et midagi on juhtunud, kuid ei pruugi selgitada põhjust.
Seetõttu peaksid AI-meeskonnad vaatama kooskõlalistest mõõdikutest kaugemale ja leidma näitajad, mis toovad esile konkureerivad tulemused. Need vastastikku kahjustavad paarid toovad esile kompromisside mõju toote toimivusele, aitavad seda jälgida ja võimaldavad teha paremaid otsuseid.
Ühes turuletoomisele eelnenud projektis arendas ühismeeskond sissetulevate klienditoekõnede jaoks reaalajas AI-hääleagenti. Üks raskemaid küsimusi ei puudutanud mudeli valikut ega orkestreerimist. Küsimus oli selles, kuidas organisatsioon saab pärast laialdase kasutuse algust teada, kas toode töötab.
Esialgne raamistik kasutas kolme mõõdikut:
Iseteenindusmäär: kui sageli lahendab AI kõne ilma seda inimesele suunamata.
Edasisuunamismäär: kui sageli suunatakse kõne inimteenindajale.
Lahendusmäär: kui sageli kliendi probleem lõpuks lahendatakse.
Iga mõõdik oli iseenesest põhjendatud. Koos ei suutnud need aga vastata ilmselgele küsimusele: mida näitab edasisuunamiste kasv?
Meeskond jagas edasisuunamised kaheksaks alamtüübiks. Seejärel lisati katkestamise, klienditeekonna ja ajastuse mõõdikud, keele mõistmise hinded ning lahendusmäär päringutüüpide kaupa. Lõpuks sisaldas raamistik kuues kategoorias 31 mõõdikut.
See kirjeldas edasisuunamisi üksikasjalikult, kuid ei suutnud endiselt nende põhjust usaldusväärselt diagnoosida. Enamik mõõdikuid olid sama käitumise variatsioonid, mistõttu liikusid need koos ega kontrollinud konkureerivaid selgitusi.
Töölaud oli muutunud diagnostilise asemel kirjeldavaks.
Meeskond ei vajanud veel üht üksikasjalikumat jaotust. Vaja oli mõõdikuid, mis piiraksid üksteist.
Nimetame neid vastastikku kahjustavateks paarideks: need on kaks mõõdikut, millest ühe eraldiseisev parandamine võib kahjustada teisega väljendatud tulemust. Nimetus kirjeldab ühepoolse optimeerimise põhjustatud ebaõnnestumist, mitte soovitud olukorda.
Kui mõlemad pooled püsivad heal tasemel, võib toode toimida kestlikult. Kui need lahknevad, aitab lahknevuse suund otsustada, mida uurida.
Mis meil oli | Vastastikku kahjustav paar | Mida paar võib näidata |
|---|---|---|
Kaheksaks alamtüübiks jagatud edasisuunamismäär | Edasisuunamismäär ↔ aeg edasisuunamiseni | Kohene edasisuunamine võib viidata usalduse või esitusviisi probleemile; hilisem edasisuunamine võib näidata, et süsteem ei suuda ülesannet lõpule viia. |
Eraldi esitatud iseteenindusmäär ja lahendusmäär | Iseteenindusmäär ↔ kliendi meelestatus | Kas iseteenindus tähendab rahuldavat lahendust või seda, et klient loobus katsest. |
Lahendusmäär kavatsuse tüübi järgi | Lahendusmäär ↔ vestluse sügavus | Kas edukas lahendus saadakse tõhusalt või nõuab see kurnavat suhtlust. |
Et paremini mõista, kuidas see ilmneb ja mida saadud teadmisega teha, vaatleme edasisuunamismäära ja aega edasisuunamiseni. Meeskond ei tea enne päris kõnede saabumist, kuidas kliendid käituvad, kuid saab määratleda kontrollitavad hüpoteesid.
Kui rohkem kõnesid suunatakse edasi ja kliendid lahkuvad AI-kogemusest esimese 30 sekundi jooksul, peaks meeskond uurima usaldust, teabe avaldamist, suhtlustooni ja vestluse algust. Kui kliendid suunavad kõne edasi pärast mitmeminutilist ülesande lahendamise katset, on tõenäolisem probleem süsteemi võimekuses või töövoo katvuses.
Edasisuunamiste põhinäitaja on sama. Tooteotsus on erinev.
Kasulik paar ei tõesta iseseisvalt põhjust. See kitsendab uurimist ja muudab järgmise otsuse selgemaks.
Eespool toodud Klarna näide näitab, kuidas seda põhimõtet rakendada kulude ja teenuse kvaliteedi koosmõju korral. See näitab, kuidas AI-toega tegevusmudel võib areneda, kui ettevõte jälgib kompromisside mõju ja õpib lahenduse kasutuselevõtust.
2024. aasta veebruaris teatas ettevõte, et AI-assistent oli esimese kuuga pidanud 2,3 miljonit vestlust, teinud 700 täiskohaga teenindaja tööga võrreldava töömahu ning saavutanud inimteenindajatega võrreldavad kliendirahulolu näitajad. Klarna hinnangul pidi assistent parandama 2024. aasta kasumit 40 miljoni dollari võrra. Need olid Klarna enda avaldatud tulemused, mitte sõltumatu hinnang.
2025. aasta mais ütles Klarna tegevjuht, et ettevõte oli klienditeeninduse kulude vähendamisele liiga palju rõhku pannud, ning kirjeldas plaane parandada inimtoe kättesaadavust. See tähendas automatiseeritud teenuse ja inimteeninduse tasakaalu kohandamist, mitte AI-assistendi ega selle aluseks oleva tehnoloogia hülgamist.
Avalik teave näitab, miks tõhususmõõdikuid tuleb käsitleda koos eri klientide ja suhtlusolukordade vajadustega. AI-süsteem võib toimida keskmiselt hästi, kuigi mõne keeruka, tundliku või ebatavalise juhtumi puhul on endiselt abi kättesaadavast inimkanalist.
Selle suhte mõlema poole jälgimine aitab ettevõttel otsustada, kus automatiseerimine loob väärtust, kus inimtugi on endiselt oluline ja kuidas tasakaalu uute tõendite põhjal muuta.
Muud vastastikku kahjustavad paarid AI-toodetes võivad olla järgmised:
Vastastikku kahjustav paar | Risk, mida see aitab esile tuua |
|---|---|
Vastuse täpsus ↔ vastuse latentsus | Süsteem, mis on tehniliselt täpne, kuid töövoo jaoks liiga aeglane. |
Ülesande täitmine ↔ kasutaja sekkumismäär | AI-töövoog, mis täidab ülesandeid, mida kasutajad korduvalt uuesti teevad. |
Kulu suhtluse kohta ↔ hinnatud väljundkvaliteet | Kokkuhoid, mis saavutatakse kliendi- või töötajakogemuse halvendamisega. |
Kasutuselevõtt ↔ väärtuse saavutamise aeg | Registreerumiste kasv, millega ei kaasne kasutajale vastavat väärtust. |
Eesmärk ei ole panna mõlemat mõõdikut lõputult kasvama. Eesmärk on muuta kompromiss nähtavaks enne, kui ühepoolne optimeerimine tekitab operatiivse probleemi.
Sarnane probleem ilmnes ühe mobiilimänguettevõtte mängijatoe lahenduses. Süsteem tegeles suure mahuga probleemidega, nagu kaotatud edenemine, maksevaidlused ja juurdepääs kontole.
Tõhususmõõdikud olid olulised, sest süsteem töötas suures mahus. Mängijatugi pole aga pelgalt operatiivne järjekord. Mängijad pöörduvad toe poole sageli pettunult, sest nende kasutuskogemuses on juba midagi valesti läinud.
See lähteolukord muudab kliendirahulolu andmete tõlgendamist. Mängija, kelle probleem lahendatakse õigesti, võib siiski anda madala rahuloluhinnangu, sest ta kaotas algselt oma edenemise. Kui hinnangut lugeda kontekstita, võib klienditeekonna varasemas etapis tekkinud pettumus ebaõiglaselt vähendada toe suhtluse hinnangut.
Seetõttu pidi meeskond eristama kliendi esialgset meelestatust toe kasutamise mõjust. Kasulikum küsimus ei olnud „Kas mängija oli rahul?“ See oli hoopis „Kas suhtlus parandas olukorda võrreldes mängija lähtepunktiga?“
See võrdlus aitab eristada tootest tingitud pettumust toe kvaliteedist, kui meeskonnal on usaldusväärne viis mõlema mõõtmiseks.
AI-tooted muutuvad, kuid nende mõõdikud jäävad sageli samaks.
Katseprojekti ajal võib keskne küsimus olla, kas süsteem on edasise investeeringu põhjendamiseks piisavalt usaldusväärne:
Kas see täidab põhiülesande usaldusväärselt?
Kas kasutajad usaldavad seda jätkamiseks piisavalt?
Kuidas käitub see väljaspool kõige tavalisemaid olukordi?
Kas tõrkeid saab tuvastada ja neist ohutult taastuda?
Nende küsimuste jaoks sobivad näiteks järgmised paarid:
põhiülesande edukus ↔ toimivus erandjuhtudel;
automatiseerimismäär ↔ inimese sekkumismäär; ja
täitmise kiirus ↔ kasutaja kindlustunne.
Kui toode muutub tegevuse jaoks oluliseks, muutuvad ka küsimused:
Kas seda saab skaleerida kvaliteeti vähendamata?
Kas selle majanduslik tasuvus paraneb kasutamise käigus?
Kas toimivus püsib kasutuselevõtu kasvades stabiilsena?
Kas inimesed sekkuvad õigetes kohtades?
Vastavad paarid võivad muutuda järgmisteks:
kulu suhtluse kohta ↔ hinnatud väljundkvaliteet;
kasutuse ulatus ↔ kasutuse sügavus; ja
automatiseerimismäär ↔ kokkupuude operatsiooniriskiga.
Varajased mõõdikud ei pruugi olla valed. Need vastavad küsimustele, mis olid olulised varasemas etapis.
Risk tekib ülemineku ajal. Katseprojekti mõõdikud jäävad sageli kasutusele, sest meeskonnad oskavad neid esitada ja keegi ei vastuta nende kasutuselt kõrvaldamise eest. Kunagi õppimist toetanud näitajad võivad järk-järgult muutuda edevusmõõdikuteks.
Seetõttu peaks paaridel olema elutsükkel. Meeskonnad peaksid võtma paari kasutusele kindla otsuse jaoks, kontrollima, kas see toob endiselt esile olulise kompromissi, ning toote või otsuse muutudes paari kasutuselt kõrvaldama.
AI-süsteemid nõuavad üksikasjalikku jälgitavust, hoiatusi, kvaliteedi tagamist ja hindamist. Nende signaalide eemaldamine raskendaks toote ohutut käitamist. Operatiivne seire ei ole aga sama mis juhtimistasandi mõõtmine.
Seire aitab meeskondadel tuvastada intsidente, leida tõrgete allikaid ja mõista süsteemi käitumist. Otsustusmõõdikud aitavad toote- ja ärijuhtidel otsustada, kas investeerida, sekkuda, suunda muuta või kompromissiga leppida.
Organisatsioon võib jälgida sadu tehnilisi ja operatiivseid signaale, kuid tõsta konkreetse tooteotsuse jaoks esile ainult kaks või kolm vastastikku kahjustavat paari. Väike otsustuskiht lihtsustab prioriteetide seadmist.
Sobiv ülevaatamise sagedus sõltub tootest. Uus või kiiresti muutuv süsteem võib vajada iganädalasi otsustusülevaatusi, küpse toote puhul võib piisata kuust või kvartalist. Põhimõte on ajavahemikust tähtsam: vaadake paari üle piisavalt sageli, et tegutseda enne, kui kompromiss muutub kulukaks või ohtlikuks.
Paar muutub kasulikuks alles siis, kui organisatsioon lepib kokku, mida selle halvenemise korral tehakse.
Selleks ei piisa lahknevuse kriitilise piiri määramisest. Meeskonnad peaksid arvestama kolme olukorraga:
Absoluutne ebaõnnestumine: üks mõõdik ületab vastuvõetamatu piiri olenemata teisest.
Lahknevus: üks mõõdik paraneb, kuid seda tasakaalustav mõõdik halveneb.
Ühine halvenemine: mõlemad pooled halvenevad, mis viitab laiemale toote- või käitusprobleemile.
Igal paaril peaks olema:
nimeline vastutaja;
selge otsus, mida see toetab;
kokkulepitud piirmäärad või hindamiskriteeriumid;
uurimisplaan; ja
võimalike sekkumiste kogum.
Ilma nende elementideta organisatsioon üksnes vaatleb toodet, mitte ei juhi seda.
Enne uue mõõdiku lisamist valige üks oluline tooteotsus ja vastake järgmistele küsimustele. Pange vastused kirja, et ülevaatuse lõpuks oleks järgmine samm kokku lepitud.
1. Millist otsust peavad need mõõdikud aitama meil teha?
Olge konkreetne: kas otsustame automatiseerimist laiendada, mudelit muuta või inimesele üleandmist parandada? Sõnastage otsus enne mõõdikute valimist.
2. Mis võib halveneda, kui see näitaja paraneb?
Tehke kindlaks tulemus, mida peate kaitsma, ja mõõdik, mis tooks kahju esile. Näiteks siduge suhtluse kulu hinnatud väljundkvaliteediga, et kontrollida, kas odavamad vastused on endiselt kasulikud.
3. Mida võivad põhinäitajad varjata?
Vaadelge mõlemat mõõdikut samade kasutajate, ülesannete ja ajavahemiku kohta ning otsige rühmi, kelle tulemused on halvemad. Arvestage ka lähteolukorda: vähene rahulolu võib kajastada pettumust, mis tekkis juba enne toe poole pöördumist.
4. Mis ajendaks meid tegutsema ja kes vastutab reageerimise eest?
Määrake tegutsemiskriteeriumid puhuks, kui mõõdik ületab vastuvõetamatu piiri, üks paraneb ja teine halveneb või mõlemad halvenevad. Leppige kokku, kes uurib, mida ta esmalt kontrollib ja millal tulemustest teatab.
5. Kas see paar sobib endiselt toote praeguse etapiga?
Otsustage, kas paar alles jätta, asendada või kasutuselt kõrvaldada. Katseprojekt võib keskenduda ülesande töökindlusele ja kasutaja usaldusele, kuid kasutusel oleva teenuse puhul tuleb kulusid ja kvaliteeti lähemalt jälgida. Määrake valiku uuesti läbivaatamise kuupäev.
AI-toote mõõtmine peaks tegema enamat kui toimivust kirjeldama. See peaks tooma esile organisatsiooni tehtavad kompromissid ja muutma järgmise otsuse selgemaks.