Dodavanje metrika ne poboljšava nužno razumijevanje. Mnoge nadzorne ploče sadrže nekoliko mjera istog osnovnog ponašanja. Metrike imaju veću dijagnostičku vrijednost kada se kombinuju u međusobno suprotstavljene parove: trošak i kvalitet, zadržavanje i raspoloženje ili tačnost i latencija.
Odgovarajući parovi mijenjaju se kako AI proizvod prelazi iz pilot-faze u produkciju. Mjerenje treba pratiti odluke koje tim mora donositi u svakoj fazi.
Operativno praćenje i strateško mjerenje imaju različite svrhe. Timovi mogu pratiti stotine sistemskih signala, a koristiti samo nekoliko parova za usmjeravanje odluka o proizvodu.
Glavne metrike mogu ispričati uvjerljivu priču, a da pritom važno pitanje o proizvodu ostane neriješeno.
Klarnin AI asistent javno se povezivao s većim protokom, nižim troškovima i ocjenama zadovoljstva korisnika uporedivim s onima ljudskih agenata. Naredne godine kompanija je odlučila proširiti pristup ljudskoj podršci, a njen izvršni direktor priznao je da je smanjenju troškova pridavana prevelika važnost.
To nije značilo odbacivanje UI asistenta ni tehnologije na kojoj se zasniva. Kompanija je, učeći iz rada proizvoda, prilagodila ravnotežu između automatizacije i ljudske usluge. Kako je automatizacija preuzimala više jednostavnijih upita velikog obima, ljudski agenti koji su bili potrebni Klarni bili su oni opremljeni za složene, osjetljive slučajeve.
Nakon što na početku utvrde šta proizvod treba postići, većina organizacija koje razvijaju AI proizvode naposljetku se suoči s istim pitanjem: funkcioniše li proizvod zaista?
Ako odgovor nije jasan, prvi impuls često je dodati još metrika. Tri postaju 10, a zatim 10 postaje 30. Nadzorna ploča sadrži sve više podataka, ali razumijevanje tima možda se ne poboljšava.
Problem nije uvijek u kvalitetu pojedinačnih mjera, već u njihovom međusobnom odnosu. Zadovoljstvo korisnika, Net Promoter Score, recenzije i udio pozitivnih ocjena mogu pružiti korisne signale, ali možda odražavaju slične promjene ukupnog raspoloženja. Kada se kreću zajedno, potvrđuju da se nešto dogodilo, ali ne objašnjavaju nužno zašto.
AI timovi stoga trebaju gledati dalje od metrika koje se međusobno slažu i utvrditi mjere koje otkrivaju suprotstavljene ishode. Takvi međusobno suprotstavljeni parovi otkrivaju i pomažu pratiti utjecaj kompromisa koji određuju učinak proizvoda, čime omogućavaju bolje odlučivanje.
U jednom projektu prije lansiranja, zajednički tim razvijao je govornog AI agenta u stvarnom vremenu za dolazne pozive korisničkoj podršci. Jedno od najtežih pitanja nije se odnosilo na izbor modela ni orkestraciju. Pitanje je bilo kako će organizacija znati funkcioniše li proizvod nakon što ga korisnici počnu masovno koristiti.
Početni okvir koristio je tri mjere:
Stopa zadržavanja: koliko često AI riješi poziv bez preusmjeravanja osobi.
Stopa eskalacije: koliko često se poziv preusmjeri ljudskom agentu.
Stopa rješavanja: koliko često se problem korisnika na kraju riješi.
Svaka od tih mjera bila je opravdana. Međutim, zajedno nisu mogle odgovoriti na očigledno pitanje: ako eskalacija raste, šta nam to govori?
Tim je eskalacije razvrstao u osam podvrsta. Zatim je dodao mjere odustajanja, korisničkog puta i vremena, ocjene razumijevanja jezika te stopu rješavanja prema vrsti upita. Okvir je na kraju obuhvatao 31 metriku u šest kategorija.
Mogao je detaljno opisati eskalaciju, ali i dalje nije mogao pouzdano utvrditi njen uzrok. Većina metrika bile su varijacije istog ponašanja, pa su se kretale zajedno umjesto da provjeravaju suprotstavljena objašnjenja.
Nadzorna ploča postala je opisna, a ne dijagnostička.
Timu nije bio potreban još jedan nivo raščlanjivanja. Bile su mu potrebne metrike koje se međusobno ograničavaju.
Nazivamo ih međusobno suprotstavljenim parovima: dvije mjere kod kojih poboljšanje jedne, posmatrane odvojeno, može naštetiti ishodu koji predstavlja druga. Naziv opisuje način nastanka problema zbog jednostrane optimizacije, a ne željeno stanje.
Kada obje strane ostanu dobre, proizvod možda radi održivo. Kada se razilaze, smjer tog odstupanja pomaže timu odlučiti šta treba istražiti.
Šta smo imali | Međusobno suprotstavljen par | Šta par može otkriti |
|---|---|---|
Stopa eskalacije podijeljena na osam podvrsta | Stopa eskalacije ↔ vrijeme do eskalacije | Trenutna eskalacija može ukazivati na problem s povjerenjem ili načinom predstavljanja; kasnija može značiti da sistem ne može izvršiti zadatak. |
Stopa zadržavanja i stopa rješavanja prikazane odvojeno | Stopa zadržavanja ↔ raspoloženje korisnika | Pokazuje znači li zadržavanje zadovoljavajuće rješenje ili odustajanje korisnika od pokušaja. |
Stopa rješavanja prema vrsti namjere | Stopa rješavanja ↔ dubina razgovora | Pokazuje je li uspješno rješenje efikasno ili zahtijeva iscrpljujuću interakciju. |
Da bismo detaljnije sagledali kako se to otkriva i šta učiniti s tim uvidom, razmotrimo stopu eskalacije i vrijeme do eskalacije. Tim neće znati kako se korisnici ponašaju dok ne stignu stvarni pozivi, ali može definirati hipoteze koje treba provjeriti.
Ako se sve više poziva počne eskalirati, a korisnici napuštaju AI iskustvo u prvih 30 sekundi, tim treba istražiti povjerenje, transparentnost, ton i početne interakcije. Ako korisnici eskaliraju nakon što su nekoliko minuta pokušavali izvršiti zadatak, vjerovatniji je problem u mogućnostima sistema ili obuhvatu radnog procesa.
Glavni pokazatelj eskalacije je isti. Odluka o proizvodu je drugačija.
Koristan par sam po sebi ne dokazuje uzrok. On sužava istragu i čini sljedeću odluku jasnijom.
Ranije navedeni primjer Klarne pokazuje kako se ovaj princip primjenjuje kada su trošak i kvalitet usluge povezani. Pokazuje kako se model poslovanja koji koristi AI može razvijati dok kompanija prati utjecaj kompromisa i uči iz primjene.
U februaru 2024. kompanija je izvijestila da je njen AI asistent u prvom mjesecu vodio 2,3 miliona razgovora, obavio posao jednak radu 700 agenata s punim radnim vremenom i postigao ocjene zadovoljstva korisnika uporedive s ljudskim agentima. Klarna je procijenila da će asistent tokom 2024. doprinijeti povećanju dobiti od 40 miliona dolara. To su bili rezultati koje je objavila sama Klarna, a ne nezavisna evaluacija.
U maju 2025. Klarnin izvršni direktor rekao je da je kompanija pridavala preveliku važnost smanjenju troškova korisničke podrške te opisao planove za proširenje pristupa ljudskoj podršci. To je značilo prilagođavanje ravnoteže između automatizovane i ljudske usluge, a ne odbacivanje AI asistenta ili tehnologije na kojoj se zasniva.
Javno dostupni podaci pokazuju zašto mjere efikasnosti treba razmatrati zajedno s potrebama različitih korisnika i vrsta interakcija. AI sistem može u prosjeku ostvarivati dobre rezultate, dok je za neke složene, osjetljive ili neuobičajene slučajeve i dalje korisna lako dostupna ljudska podrška.
Praćenje obje strane tog odnosa pomaže kompaniji odlučiti gdje automatizacija stvara vrijednost, gdje ljudska podrška ostaje važna i kako prilagođavati ravnotežu s pojavom novih dokaza.
Drugi međusobno suprotstavljeni parovi za AI proizvode mogu uključivati:
Međusobno suprotstavljen par | Rizik koji pomaže otkriti |
|---|---|
Tačnost odgovora ↔ latencija odgovora | Sistem koji je tehnički tačan, ali prespor za radni proces. |
Izvršavanje zadataka ↔ stopa korisničkih izmjena | AI radni proces izvršava zadatke koje korisnici zatim više puta rade ispočetka. |
Trošak po interakciji ↔ procijenjeni kvalitet rezultata | Uštede ostvarene pogoršanjem iskustva korisnika ili zaposlenika. |
Prihvaćenost ↔ vrijeme do ostvarivanja vrijednosti | Rast broja registracija bez odgovarajuće vrijednosti za korisnike. |
Cilj nije da obje mjere neograničeno rastu. Cilj je učiniti kompromis vidljivim prije nego što jednostrana optimizacija izazove operativni problem.
Sličan izazov pojavio se pri uvođenju podrške igračima za kompaniju koja razvija mobilne igre. Sistem je rješavao veliki broj problema kao što su izgubljeni napredak, sporovi u vezi s plaćanjem i pristup računu.
Mjere efikasnosti bile su važne jer je sistem radio u velikom obimu. Ali podrška igračima nije samo operativni red čekanja. Igrači često dolaze frustrirani jer je nešto već pošlo po zlu u drugom dijelu njihovog iskustva.
Ta početna situacija mijenja način tumačenja podataka o zadovoljstvu korisnika. Igrač čiji je problem ispravno riješen ipak može prijaviti nisko zadovoljstvo jer je prije svega izgubio napredak. Tumačenje te ocjene bez konteksta može nepravedno pripisati interakciji s podrškom frustraciju nastalu ranije na korisničkom putu.
Tim je zato morao razlikovati početno raspoloženje korisnika od učinka iskustva s podrškom. Korisnije pitanje nije bilo: „Je li igrač bio zadovoljan?“ Nego: „Je li interakcija poboljšala situaciju u odnosu na onu u kojoj se igrač nalazio na početku?“
To poređenje može pomoći da se frustracija proizvodom razdvoji od kvaliteta podrške, pod uslovom da tim može pouzdano mjeriti oboje.
AI proizvodi se mijenjaju, ali njihove metrike često ostaju iste.
Tokom pilot-faze ključno pitanje može biti je li sistem dovoljno pouzdan da opravda nastavak ulaganja:
Izvršava li pouzdano osnovni zadatak?
Vjeruju li mu korisnici dovoljno da ga nastave koristiti?
Kako se ponaša izvan najčešćih scenarija?
Mogu li se greške prepoznati i sigurno otkloniti?
Ta pitanja daju prednost parovima kao što su:
uspjeh osnovnog zadatka ↔ učinak u rubnim slučajevima;
stopa automatizacije ↔ stopa ljudskih intervencija; i
brzina izvršavanja ↔ povjerenje korisnika.
Kada proizvod postane operativno važan, pitanja se mijenjaju:
Može li se širiti bez smanjenja kvaliteta?
Poboljšava li se njegova ekonomičnost korištenjem?
Ostaje li učinak stabilan kako prihvaćenost raste?
Događaju li se ljudske intervencije na pravim mjestima?
Odgovarajući parovi mogu se promijeniti u:
trošak po interakciji ↔ procijenjeni kvalitet rezultata;
širina prihvaćenosti ↔ dubina korištenja; i
stopa automatizacije ↔ izloženost operativnom riziku.
Početne metrike nisu nužno pogrešne. One odgovaraju na pitanja koja su bila važna u ranijoj fazi.
Rizik nastaje tokom prelaska u novu fazu. Metrike iz pilot-faze često opstaju jer ih timovi znaju prikazivati, a niko nije zadužen da odluči o njihovom ukidanju. Mjere koje su nekada podržavale učenje mogu postepeno postati isprazne metrike.
Parovi bi stoga trebali imati svoj životni ciklus. Timovi ih trebaju uvesti radi određene odluke, provjeravati otkrivaju li još uvijek važan kompromis i ukinuti ih kada se proizvod ili odluka promijene.
AI sistemi zahtijevaju detaljnu opservabilnost, upozorenja, osiguranje kvaliteta i evaluaciju. Uklanjanje tih signala otežalo bi siguran rad proizvoda. Ali operativno praćenje nije isto što i mjerenje za potrebe rukovodstva.
Praćenje pomaže timovima otkriti incidente, pronaći uzroke grešaka i razumjeti ponašanje sistema. Metrike za odlučivanje pomažu rukovodiocima proizvoda i poslovanja odlučiti treba li ulagati, intervenirati, promijeniti smjer ili prihvatiti kompromis.
Organizacija može pratiti stotine tehničkih i operativnih signala, a za konkretnu odluku o proizvodu izdvojiti samo dva ili tri međusobno suprotstavljena para. Održavanje tog nivoa odlučivanja jednostavnim olakšava određivanje prioriteta.
Odgovarajuća učestalost pregleda zavisi od proizvoda. Novi sistem ili sistem koji se brzo mijenja može zahtijevati sedmične preglede odluka, dok zrelom proizvodu može odgovarati mjesečni ili tromjesečni ritam. Princip je važniji od intervala: pregledajte par dovoljno često da reagujete prije nego što kompromis postane skup ili nesiguran.
Par postaje koristan tek kada se organizacija usaglasi šta će se dogoditi ako se njegovi pokazatelji pogoršaju.
Za to nije dovoljno samo odrediti krajnju granicu razilaženja. Timovi trebaju razmotriti tri uslova:
Apsolutni neuspjeh: jedna mjera prelazi neprihvatljiv prag, bez obzira na drugu.
Razilaženje: jedna mjera se poboljšava dok se njena protuteža pogoršava.
Zajedničko pogoršanje: obje strane opadaju, što ukazuje na širi problem s proizvodom ili njegovim radom.
Svaki par treba imati:
imenovanu odgovornu osobu;
jasnu odluku koju podržava;
dogovorene pragove ili kriterije evaluacije;
plan istrage; i
skup mogućih intervencija.
Bez tih elemenata organizacija samo posmatra proizvod umjesto da njime upravlja.
Prije nego što dodate novu mjeru, odaberite jednu važnu odluku o proizvodu i razmotrite ova pitanja. Zapišite odgovore kako bi pregled završio dogovorenim sljedećim korakom.
1. Pri donošenju koje odluke nam ove metrike trebaju pomoći?
Budite konkretni: odlučujemo li o proširenju automatizacije, promjeni modela ili poboljšanju preusmjeravanja na osobu? Prije izbora mjera jasno odredite odluku.
2. Ako se ovaj broj poboljša, šta bi se moglo pogoršati?
Utvrdite ishod koji trebate zaštititi i mjeru koja bi otkrila štetu. Naprimjer, uparite trošak po interakciji s procijenjenim kvalitetom rezultata kako biste provjerili jesu li jeftiniji odgovori i dalje korisni.
3. Šta bi glavni pokazatelji mogli skrivati?
Posmatrajte obje mjere za iste korisnike, zadatke i vremenski period, a zatim potražite grupe koje ostvaruju lošije rezultate. Uzmite u obzir i početne okolnosti: nisko zadovoljstvo može odražavati frustraciju koja je postojala prije interakcije s podrškom.
4. Šta bi nas navelo na djelovanje i ko je odgovoran za odgovor?
Odredite kriterije za djelovanje kada mjera pređe neprihvatljivu granicu, kada se jedna poboljšava dok se druga pogoršava ili kada se obje pogoršaju. Dogovorite ko će provesti istragu, šta će prvo provjeriti i kada će izvijestiti o rezultatima.
5. Odgovara li ovaj par još uvijek trenutnoj fazi proizvoda?
Odlučite hoćete li ga zadržati, zamijeniti ili ukinuti. Pilot-projekt može biti usmjeren na pouzdanost zadataka i povjerenje korisnika, dok aktivna usluga može zahtijevati pomnije praćenje troškova i kvaliteta. Odredite datum za preispitivanje izbora.
Mjerenje AI proizvoda treba činiti više od opisivanja učinka. Treba otkriti kompromise koje organizacija pravi i učiniti sljedeću odluku jasnijom.