Dodavanje metrika ne poboljšava nužno razumijevanje. Mnoge nadzorne ploče sadržavaju nekoliko mjera istog temeljnog ponašanja. Metrike imaju veću dijagnostičku vrijednost kada se spoje u međusobno suprotstavljene parove: trošak i kvaliteta, zadržavanje i sentiment ili točnost i latencija.
Odgovarajući parovi mijenjaju se kako AI proizvod prelazi iz pilot-faze u produkciju. Mjerenje treba pratiti odluke koje tim mora donositi u svakoj fazi.
Operativno praćenje i strateško mjerenje imaju različite svrhe. Timovi mogu pratiti stotine signala sustava, a za donošenje odluka o proizvodu služiti se tek nekolicinom parova.
Glavne metrike mogu ispričati uvjerljivu priču, a da pritom važno pitanje o proizvodu ostane neriješeno.
Klarnin AI asistent u javnosti se povezivao s većom propusnošću, nižim troškovima i ocjenama zadovoljstva korisnika usporedivima s onima ljudskih agenata. Sljedeće godine tvrtka je odlučila povećati dostupnost ljudske podrške, a njezin glavni izvršni direktor priznao je da se prevelik naglasak stavljao na smanjenje troškova.
To nije značilo odbacivanje AI asistenta ni tehnologije na kojoj se temelji. Tvrtka je, učeći iz rada proizvoda, prilagodila ravnotežu između automatizacije i ljudske usluge. Kako je automatizacija preuzimala sve veći dio jednostavnijih upita velikog opsega, Klarni su bili potrebni ljudski agenti osposobljeni za složene, osjetljive slučajeve.
Nakon što od početka definiraju što bi proizvod trebao postići, većina organizacija koje razvijaju AI proizvode naposljetku će se suočiti s istim pitanjem: funkcionira li doista?
Ako odgovor nije jasan, prvi je poriv često dodati još metrika. Tri postanu 10, a zatim 10 postane 30. Nadzorna ploča postaje bogatija, no tim možda ništa bolje ne razumije.
Problem nije uvijek u kvaliteti pojedinačnih mjera, nego u njihovu međusobnom odnosu. Zadovoljstvo korisnika, Net Promoter Score, recenzije i udio pozitivnih ocjena mogu pružiti korisne signale, ali mogu odražavati slične promjene općeg sentimenta. Kada se kreću zajedno, potvrđuju da se nešto dogodilo, ali ne objašnjavaju nužno zašto.
AI timovi stoga trebaju gledati dalje od metrika koje se međusobno potvrđuju i utvrditi mjere koje otkrivaju suprotstavljene ishode. Ti međusobno suprotstavljeni parovi otkrivaju učinak kompromisa na uspješnost proizvoda i pomažu ga pratiti, što omogućuje bolje odlučivanje.
U jednom projektu prije lansiranja zajednički je tim razvijao govornog AI agenta u stvarnom vremenu za dolazne pozive korisničkoj podršci. Jedno od najtežih pitanja nije se odnosilo na odabir modela ni orkestraciju. Pitanje je bilo kako će organizacija znati funkcionira li proizvod nakon što ga korisnici počnu upotrebljavati u velikom opsegu.
Početni okvir obuhvaćao je tri mjere:
Stopa zadržavanja: koliko često AI riješi poziv bez preusmjeravanja osobi.
Stopa eskalacije: koliko se često poziv preusmjeri ljudskom agentu.
Stopa rješavanja: koliko često korisnikov problem naposljetku bude riješen.
Svaka je mjera bila opravdana. Međutim, zajedno nisu mogle odgovoriti na očito pitanje: što nam govori porast eskalacija?
Tim je raščlanio eskalacije na osam podvrsta. Zatim je dodao mjere odustajanja, korisničkog puta i vremena, ocjene razumijevanja jezika te rješavanje prema vrsti upita. Okvir je naposljetku sadržavao 31 metriku u šest kategorija.
Mogao je detaljno opisati eskalaciju, ali još nije mogao pouzdano dijagnosticirati njezin uzrok. Većina metrika bile su varijacije istog ponašanja pa su se kretale zajedno umjesto da provjeravaju suprotstavljena objašnjenja.
Nadzorna ploča postala je opisna, a ne dijagnostička.
Timu nije trebao još jedan sloj raščlambe. Trebale su mu metrike koje se međusobno ograničavaju.
Nazivamo ih međusobno suprotstavljenim parovima: dvije mjere kod kojih zasebno poboljšanje jedne može naštetiti ishodu koji predstavlja druga. Naziv opisuje način na koji jednostrana optimizacija može dovesti do neuspjeha, a ne željeno stanje.
Ako obje strane ostanu zdrave, proizvod možda funkcionira održivo. Kada počnu odstupati, smjer tog odstupanja pomaže timu odlučiti što treba istražiti.
Što smo imali | Međusobno suprotstavljen par | Što par može otkriti |
|---|---|---|
Stopa eskalacije podijeljena na osam podvrsta | Stopa eskalacije ↔ vrijeme do eskalacije | Trenutačna eskalacija može upućivati na problem s povjerenjem ili predstavljanjem usluge; kasnija eskalacija može značiti da sustav ne može dovršiti zadatak. |
Stopa zadržavanja i stopa rješavanja prikazane zasebno | Stopa zadržavanja ↔ sentiment korisnika | Znači li zadržavanje zadovoljavajuće rješenje ili odustajanje korisnika od pokušaja. |
Stopa rješavanja prema vrsti namjere | Stopa rješavanja ↔ dubina razgovora | Je li uspješno rješenje učinkovito ili zahtijeva iscrpljujuću interakciju. |
Kako bismo podrobnije razmotrili kako se to otkriva i što učiniti s tim uvidom, pogledajmo stopu eskalacije i vrijeme do eskalacije. Tim neće znati kako se korisnici ponašaju dok ne stignu stvarni pozivi, ali može definirati hipoteze koje treba provjeriti.
Ako se sve više poziva eskalira, a korisnici napuste AI iskustvo unutar prvih 30 sekundi, tim treba istražiti povjerenje, transparentnost, ton i početne interakcije. Ako korisnici eskaliraju nakon što nekoliko minuta pokušavaju izvršiti zadatak, vjerojatniji je problem u mogućnostima ili obuhvatu radnog procesa.
Glavni broj eskalacija isti je. Odluka o proizvodu nije.
Koristan par sam po sebi ne dokazuje uzrok. On sužava istragu i pojašnjava sljedeću odluku.
Prethodno naveden primjer Klarne pokazuje kako se ovo načelo primjenjuje u međudjelovanju troška i kvalitete usluge. Pokazuje kako se operativni model potpomognut AI-jem može razvijati dok tvrtka prati učinak kompromisa i uči iz uvođenja proizvoda.
U veljači 2024. tvrtka je izvijestila da je njezin AI asistent u prvom mjesecu vodio 2,3 milijuna razgovora, obavio posao jednak radu 700 agenata s punim radnim vremenom te postigao ocjene zadovoljstva korisnika usporedive s ljudskim agentima. Klarna je procijenila da će asistent tijekom 2024. pridonijeti povećanju dobiti od 40 milijuna USD. To su bili rezultati koje je objavila sama Klarna, a ne neovisna evaluacija.
U svibnju 2025. Klarnin glavni izvršni direktor izjavio je da je tvrtka u korisničkoj podršci stavila prevelik naglasak na smanjenje troškova te opisao planove za povećanje dostupnosti ljudske podrške. To je bila prilagodba ravnoteže između automatizirane i ljudske usluge, a ne odbacivanje AI asistenta ili tehnologije na kojoj se temelji.
Javno dostupni podaci pokazuju zašto mjere učinkovitosti treba razmatrati zajedno s potrebama različitih korisnika i interakcija. AI sustav može u prosjeku biti uspješan, dok je za neke složene, osjetljive ili neuobičajene slučajeve i dalje koristan lako dostupan ljudski kanal.
Praćenje obiju strana tog odnosa pomaže tvrtki odlučiti gdje automatizacija stvara vrijednost, gdje je ljudska podrška i dalje važna te kako prilagođavati ravnotežu s pojavom novih dokaza.
Drugi međusobno suprotstavljeni parovi u AI proizvodima mogu uključivati:
Međusobno suprotstavljen par | Rizik koji pomaže otkriti |
|---|---|
Točnost odgovora ↔ latencija odgovora | Sustav koji je tehnički točan, ali prespor za radni proces. |
Dovršavanje zadatka ↔ stopa korisničkih poništavanja | AI radni proces dovršava zadatke koje korisnici redovito ponovno obavljaju. |
Trošak po interakciji ↔ procijenjena kvaliteta rezultata | Uštede ostvarene nauštrb iskustva korisnika ili zaposlenika. |
Prihvaćenost ↔ vrijeme do ostvarivanja vrijednosti | Rast broja registracija bez odgovarajuće vrijednosti za korisnika. |
Cilj nije postići da obje mjere rastu unedogled. Cilj je učiniti kompromis vidljivim prije nego što jednostrana optimizacija stvori operativni problem.
Sličan izazov pojavio se pri uvođenju podrške igračima za tvrtku koja razvija mobilne igre. Sustav je rješavao velik broj problema poput izgubljenog napretka, sporova oko plaćanja i pristupa računu.
Mjere učinkovitosti bile su važne jer je sustav radio u velikom opsegu. No podrška igračima nije samo operativni red čekanja. Igrači često dolaze frustrirani jer je nešto već pošlo po zlu u drugom dijelu njihova iskustva.
To početno stanje mijenja način tumačenja podataka o zadovoljstvu korisnika. Igrač čiji je problem ispravno riješen i dalje može prijaviti nisko zadovoljstvo jer je prije svega izgubio napredak. Tumačenje te ocjene bez konteksta može nepravedno pripisati interakciji s podrškom frustraciju nastalu ranije na korisničkom putu.
Tim je stoga morao razlikovati početni sentiment korisnika od učinka iskustva s podrškom. Korisnije pitanje nije bilo: „Je li igrač bio zadovoljan?“ Nego: „Je li interakcija poboljšala situaciju u odnosu na igračevu početnu poziciju?“
Ta usporedba može pomoći razdvojiti frustraciju proizvodom od kvalitete podrške, pod uvjetom da tim može pouzdano izmjeriti oboje.
AI proizvodi mijenjaju se, ali njihove metrike često ostaju iste.
Tijekom pilot-faze ključno pitanje može biti je li sustav dovoljno pouzdan da opravda daljnje ulaganje:
Dovršava li pouzdano glavni zadatak?
Vjeruju li mu korisnici dovoljno da nastave?
Kako se ponaša izvan najčešćih scenarija?
Mogu li se neuspjesi prepoznati i sigurno otkloniti?
Ta pitanja daju prednost parovima kao što su:
uspješnost glavnog zadatka ↔ uspješnost u rubnim slučajevima;
stopa automatizacije ↔ stopa ljudskih poništavanja; i
brzina dovršavanja ↔ povjerenje korisnika.
Kada proizvod postane operativno važan, pitanja se mijenjaju:
Može li se skalirati bez smanjenja kvalitete?
Poboljšava li se njegova ekonomičnost upotrebom?
Ostaje li uspješnost stabilna s rastom prihvaćenosti?
Događaju li se ljudske intervencije na pravim mjestima?
Odgovarajući parovi mogu se promijeniti u:
trošak po interakciji ↔ procijenjena kvaliteta rezultata;
širina prihvaćenosti ↔ dubina upotrebe; i
stopa automatizacije ↔ izloženost operativnom riziku.
Početne metrike nisu nužno pogrešne. One odgovaraju na pitanja koja su bila važna u ranijoj fazi.
Rizik se pojavljuje tijekom prijelaza. Metrike iz pilot-faze često ostaju jer ih timovi znaju prikazivati, a nitko nije zadužen za odluku o njihovu ukidanju. Mjere koje su nekoć podržavale učenje mogu postupno postati isprazne metrike.
Parovi bi stoga trebali imati životni ciklus. Timovi ih trebaju uvesti radi određene odluke, provjeravati otkrivaju li još bitan kompromis te ih ukinuti kada se proizvod ili odluka promijene.
AI sustavi zahtijevaju detaljnu opservabilnost, upozorenja, osiguravanje kvalitete i evaluaciju. Uklanjanje tih signala otežalo bi sigurno upravljanje proizvodom. No operativno praćenje nije isto što i mjerenje za potrebe rukovodstva.
Praćenje pomaže timovima otkriti incidente, pronaći uzroke neuspjeha i razumjeti ponašanje sustava. Metrike za odlučivanje pomažu voditeljima proizvoda i poslovanja odlučiti treba li ulagati, intervenirati, promijeniti smjer ili prihvatiti kompromis.
Organizacija može pratiti stotine tehničkih i operativnih signala, a za određenu odluku o proizvodu izdvojiti samo dva ili tri međusobno suprotstavljena para. Mali broj metrika na toj razini odlučivanja olakšava određivanje prioriteta.
Primjerena učestalost pregleda ovisi o proizvodu. Novi sustav ili sustav koji se brzo mijenja može zahtijevati tjedne preglede odluka, dok za zreo proizvod mogu biti dovoljni mjesečni ili tromjesečni pregledi. Načelo je važnije od intervala: pregledavajte par dovoljno često da možete djelovati prije nego što kompromis postane skup ili nesiguran.
Par postaje koristan tek kada se organizacija dogovori što će se dogoditi ako se pogorša.
Za to nije dovoljno odrediti kritičnu granicu odstupanja. Timovi trebaju razmotriti tri uvjeta:
Apsolutni neuspjeh: jedna mjera prelazi neprihvatljivi prag, neovisno o drugoj.
Odstupanje: jedna se mjera poboljšava, dok se njezina protuteža pogoršava.
Zajedničko pogoršanje: obje strane slabe, što upućuje na širi problem s proizvodom ili poslovanjem.
Svaki par treba imati:
imenovanu odgovornu osobu;
jasnu odluku kojoj služi;
dogovorene pragove ili kriterije evaluacije;
plan istrage; i
skup mogućih intervencija.
Bez tih elemenata organizacija samo promatra proizvod umjesto da njime upravlja.
Prije dodavanja nove mjere odaberite jednu važnu odluku o proizvodu i razmotrite sljedeća pitanja. Zapišite odgovore kako bi pregled završio dogovorenim sljedećim korakom.
1. Koju nam odluku ove metrike trebaju pomoći donijeti?
Budite konkretni: odlučujemo li o proširenju automatizacije, promjeni modela ili poboljšanju prijenosa ljudskom agentu? Odredite odluku prije nego što odaberete mjere.
2. Ako se ovaj broj poboljša, što bi se moglo pogoršati?
Utvrdite ishod koji trebate zaštititi i mjeru koja bi otkrila štetu. Primjerice, uparite trošak po interakciji s procijenjenom kvalitetom rezultata kako biste provjerili jesu li jeftiniji odgovori i dalje korisni.
3. Što bi glavni pokazatelji mogli skrivati?
Očitajte obje mjere za iste korisnike, zadatke i razdoblje, a zatim potražite skupine s lošijim ishodima. Razmotrite i početne okolnosti: nisko zadovoljstvo može odražavati frustraciju koja je prethodila interakciji s podrškom.
4. Što bi nas potaknulo na djelovanje i tko je odgovoran za reakciju?
Odredite kriterije za djelovanje kada mjera prijeđe neprihvatljivu granicu, kada se jedna poboljša, a druga pogorša ili kada se obje pogoršaju. Dogovorite tko će istražiti problem, što će prvo provjeriti i kada će izvijestiti o rezultatima.
5. Odgovara li ovaj par još uvijek trenutačnoj fazi proizvoda?
Odlučite hoćete li ga zadržati, zamijeniti ili ukinuti. Pilot-projekt može biti usmjeren na pouzdanost zadatka i povjerenje korisnika, dok aktivna usluga može zahtijevati pomnije praćenje troška i kvalitete. Odredite datum ponovnog razmatranja odluke.
Mjerenje AI proizvoda treba činiti više od opisivanja uspješnosti. Treba otkriti kompromise koje organizacija prihvaća i učiniti sljedeću odluku jasnijom.