Hlavná navigácia

Sledovanie dosahu kompromisov pri tvorbe produktov AI

Odhaľovanie skrytých kompromisov pomáha tímom diagnostikovať zlyhania produktov AI a prijímať lepšie rozhodnutia.

Hlavné poznatky pre vedenie

  • Pridanie metrík nemusí nevyhnutne zlepšiť pochopenie. Mnohé informačné panely obsahujú viacero ukazovateľov toho istého základného správania. Metriky majú väčšiu diagnostickú hodnotu, keď sa kombinujú do vzájomne protichodných dvojíc: náklady s kvalitou, vyriešenia problému bez odovzdania s náladou zákazníkov alebo presnosť s latenciou.

  • Správne dvojice sa menia pri prechode produktu AI z pilotnej fázy do produkcie. Meranie by sa malo v každej fáze riadiť rozhodnutiami, ktoré tím potrebuje prijať.

  • Prevádzkové monitorovanie a strategické meranie slúžia na odlišné účely. Tímy môžu sledovať stovky systémových signálov, no pri rozhodovaní o produkte sa riadiť iba niekoľkými dvojicami.

Hlavné metriky môžu pôsobiť presvedčivo, no dôležité rozhodnutie o produkte pritom zostane nevyriešené.

Asistent AI spoločnosti Klarna sa verejne spájal s vyššou priepustnosťou, nižšími nákladmi a hodnotením spokojnosti zákazníkov porovnateľným s ľudskými agentmi. V nasledujúcom roku sa spoločnosť rozhodla rozšíriť prístup k ľudskej podpore, pričom jej generálny riaditeľ uznal, že znižovaniu nákladov sa prikladal priveľký dôraz.

Nešlo o odmietnutie asistenta AI ani technológie, na ktorej je založený. Spoločnosť na základe skúseností z prevádzky produktu upravila rovnováhu medzi automatizáciou a ľudskou obsluhou. Keď automatizácia preberala väčšie množstvo jednoduchších dopytov, spoločnosť Klarna potrebovala ľudských agentov schopných riešiť zložité citlivé prípady.

Viac metrík nemusí vždy priniesť väčšiu jasnosť

Keď si organizácie vyvíjajúce produkty AI hneď na začiatku určia, čo má produkt dosiahnuť, napokon väčšinou stoja pred rovnakou otázkou: naozaj funguje?

Ak odpoveď nie je jasná, prvým impulzom býva pridať ďalšie metriky. Z troch je 10 a potom z 10 až 30. Informačný panel obsahuje čoraz viac údajov, no tím nemusí produktu rozumieť lepšie.

Problémom nie je vždy kvalita jednotlivých ukazovateľov, ale ich vzájomný vzťah. Spokojnosť zákazníkov, Net Promoter Score, recenzie aj podiel kladných hodnotení môžu poskytovať užitočné signály, no často odrážajú podobné zmeny celkovej nálady. Keď sa vyvíjajú súbežne, potvrdzujú, že sa niečo stalo, ale nemusia vysvetliť prečo.

Tímy AI by sa preto mali pozerať aj za hranice metrík, ktoré sa navzájom zhodujú, a hľadať ukazovatele odhaľujúce protichodné výsledky. Tieto vzájomne protichodné dvojice odhaľujú kompromisy ovplyvňujúce výkon produktu, pomáhajú sledovať ich dosah a umožňujú lepšie rozhodovanie.

Sledovanie kompromisov pri tvorbe hlasových agentov v reálnom čase: keď viac metrík prestalo pomáhať

Pri jednom nasadení pred spustením vyvíjal spoločný tím hlasového agenta AI v reálnom čase pre prichádzajúce hovory zákazníckej podpory. Jedna z najťažších otázok sa netýkala výberu ani orchestrácie modelu. Išlo o to, ako organizácia po rozšírení používania medzi zákazníkmi zistí, či produkt funguje.

Pôvodný rámec používal tri ukazovatele:

  • Miera vyriešenia bez odovzdania: ako často AI vyrieši hovor bez jeho presmerovania na človeka.

  • Miera eskalácie: ako často sa hovor presmeruje na ľudského agenta.

  • Miera úspešného vyriešenia: ako často sa problém zákazníka napokon vyrieši.

Každý ukazovateľ bol opodstatnený. Spoločne však nedokázali zodpovedať očividnú otázku: čo nám prezrádza rastúca eskalácia?

Tím rozdelil eskalácie na osem podtypov. Potom pridal ukazovatele prerušenia, priebehu a času, skóre porozumenia jazyku a mieru úspešného vyriešenia podľa typu požiadavky. Rámec napokon obsahoval 31 metrík v šiestich kategóriách.

Dokázal podrobne opísať eskaláciu, stále však nevedel spoľahlivo určiť jej príčinu. Väčšina metrík predstavovala obmeny toho istého správania, takže sa vyvíjali súbežne namiesto toho, aby overovali protichodné vysvetlenia.

Informačný panel už slúžil na pozorovanie, nie na diagnostiku.

Odhaľujte kompromisy pomocou vzájomne protichodných dvojíc

Tím nepotreboval ďalšiu úroveň členenia. Potreboval metriky, ktoré sa navzájom obmedzujú.

Nazývame ich vzájomne protichodné dvojice: dva ukazovatele, pri ktorých môže izolované zlepšovanie jedného poškodiť výsledok vyjadrený druhým. Názov opisuje spôsob zlyhania spôsobený jednostrannou optimalizáciou, nie želaný stav.

Ak zostávajú obe strany v dobrom stave, produkt môže fungovať udržateľne. Keď sa začnú rozchádzať, smer odchýlky pomôže tímu rozhodnúť, čo má preskúmať.

Čo sme mali

Vzájomne protichodná dvojica

Čo môže dvojica odhaliť

Miera eskalácie rozdelená na osem podtypov

Miera eskalácie ↔ čas do eskalácie

Okamžitá eskalácia môže naznačovať problém s dôverou alebo úvodným nastavením očakávaní; neskoršia eskalácia môže znamenať, že systém nedokáže úlohu dokončiť.

Miera vyriešenia bez odovzdania a miera úspešného vyriešenia vykazované samostatne

Miera vyriešenia bez odovzdania ↔ nálada zákazníkov

Či vyriešenie bez odovzdania znamená uspokojivé riešenie, alebo zákazník pokus vzdal.

Miera úspešného vyriešenia podľa typu zámeru

Miera úspešného vyriešenia ↔ hĺbka konverzácie

Či je úspešné vyriešenie efektívne, alebo si vyžaduje vyčerpávajúcu interakciu.

Pozrime sa podrobnejšie na to, ako sa tento jav prejavuje a ako tento poznatok využiť, na príklade miery eskalácie a času do eskalácie. Tím nebude vedieť, ako sa zákazníci zachovajú, kým neprídu skutočné hovory, môže však vopred určiť hypotézy, ktoré potrebuje overiť.

Ak sa začne eskalovať viac hovorov a zákazníci opúšťajú interakciu s AI už počas prvých 30 sekúnd, tím by mal preskúmať dôveru, informovanie, tón a úvodnú komunikáciu. Ak zákazníci eskalujú až po niekoľkých minútach pokusov dokončiť úlohu, pravdepodobnejším problémom sú schopnosti alebo pokrytie pracovného postupu.

Hlavný údaj o eskalácii je rovnaký. Rozhodnutie o produkte je však odlišné.

Užitočná dvojica sama osebe príčinu nedokazuje. Zužuje rozsah vyšetrovania a objasňuje ďalšie rozhodnutie.

Náklady a kvalitu treba posudzovať spoločne

Už spomenutý príklad spoločnosti Klarna ukazuje, ako tento princíp funguje pri vzájomnom pôsobení nákladov a kvality služieb. Ukazuje, ako sa môže prevádzkový model využívajúci AI vyvíjať, keď spoločnosť sleduje dosah kompromisov a učí sa zo svojho nasadenia.

Vo februári 2024 spoločnosť uviedla, že jej asistent AI počas prvého mesiaca zvládol 2,3 milióna konverzácií, vykonal prácu zodpovedajúcu 700 agentom na plný úväzok a dosiahol hodnotenie spokojnosti zákazníkov porovnateľné s ľudskými agentmi. Klarna odhadovala, že asistent prispeje v roku 2024 k zvýšeniu zisku o 40 miliónov dolárov. Išlo o výsledky vykázané samotnou spoločnosťou Klarna, nie o nezávislé hodnotenie.

V máji 2025 generálny riaditeľ spoločnosti Klarna uviedol, že spoločnosť kládla pri zákazníckej podpore priveľký dôraz na znižovanie nákladov, a predstavil plány na rozšírenie prístupu k ľudskej podpore. Išlo o úpravu rovnováhy medzi automatizovanou a ľudskou obsluhou, nie o odmietnutie asistenta AI alebo technológie, na ktorej je založený.

Verejne dostupné dôkazy ukazujú, prečo treba ukazovatele efektívnosti posudzovať spolu s potrebami rôznych zákazníkov a typov interakcií. Systém AI môže dosahovať dobré priemerné výsledky, no pri niektorých zložitých, citlivých alebo nezvyčajných prípadoch je stále prínosný dostupný ľudský kanál.

Sledovanie oboch strán tohto vzťahu pomáha spoločnosti rozhodovať, kde automatizácia vytvára hodnotu, kde zostáva dôležitá ľudská podpora a ako meniť rovnováhu s pribúdajúcimi poznatkami.

Medzi ďalšie vzájomne protichodné dvojice pri produktoch AI môžu patriť:

Vzájomne protichodná dvojica

Riziko, ktoré pomáha odhaliť

Presnosť odpovede ↔ latencia odpovede

Systém, ktorý je technicky presný, ale pre daný pracovný postup príliš pomalý.

Dokončenie úlohy ↔ miera zásahov používateľa

Pracovný postup AI dokončuje úlohy, ktoré používatelia opakovane prerábajú.

Náklady na interakciu ↔ vyhodnotená kvalita výstupu

Úspory dosiahnuté zhoršením skúsenosti zákazníkov alebo zamestnancov.

Prijatie ↔ čas do získania hodnoty

Rast počtu registrácií bez zodpovedajúcej hodnoty pre používateľov.

Cieľom nie je, aby oba ukazovatele rástli donekonečna. Cieľom je zviditeľniť kompromis skôr, než jednostranná optimalizácia spôsobí prevádzkový problém.

Východisková situácia zákazníka mení význam metriky

S podobným problémom sa stretlo nasadenie hráčskej podpory pre spoločnosť vyvíjajúcu mobilné hry. Systém riešil veľké množstvo problémov, ako sú strata postupu, spory o platby a prístup k účtu.

Ukazovatele efektívnosti boli dôležité, pretože systém fungoval vo veľkom rozsahu. Hráčska podpora však nie je iba prevádzkovým radom požiadaviek. Hráči často prichádzajú frustrovaní, pretože už predtým sa v rámci ich skúsenosti niečo pokazilo.

Táto východisková situácia mení spôsob interpretácie údajov o spokojnosti zákazníkov. Hráč môže aj po správnom vyriešení problému uviesť nízku spokojnosť, pretože vôbec došlo k strate postupu. Ak sa toto skóre posudzuje bez kontextu, interakcia s podporou môže byť penalizovaná za frustráciu, ktorá vznikla už skôr na ceste zákazníka.

Tím preto potreboval odlíšiť východiskové rozpoloženie zákazníka od vplyvu skúsenosti s podporou. Užitočnejšia otázka nebola: „Bol hráč spokojný?“ Bola to otázka: „Zlepšila interakcia situáciu oproti stavu, v ktorom sa hráč nachádzal na začiatku?“

Takéto porovnanie môže pomôcť odlíšiť frustráciu z produktu od kvality podpory, ak má tím spoľahlivý spôsob merania oboch.

Meranie sa má meniť spolu s produktom

Produkty AI sa menia, ich metriky však často zostávajú nemenné.

V pilotnej fáze môže byť hlavnou otázkou, či je systém dostatočne dôveryhodný na to, aby odôvodnil ďalšie investície:

  • Dokáže spoľahlivo dokončiť základnú úlohu?

  • Dôverujú mu používatelia natoľko, aby ho používali aj naďalej?

  • Ako sa správa mimo najbežnejších scenárov?

  • Možno zlyhania odhaliť a bezpečne sa z nich zotaviť?

Tieto otázky uprednostňujú dvojice, ako sú:

  • úspešnosť základnej úlohy ↔ výkon v okrajových prípadoch;

  • miera automatizácie ↔ miera zásahov človeka; a

  • rýchlosť dokončenia ↔ dôvera používateľov.

Keď produkt nadobudne prevádzkový význam, otázky sa zmenia:

  • Dokáže sa škálovať bez zníženia kvality?

  • Zlepšuje sa jeho hospodárnosť s rastúcim používaním?

  • Zostáva výkon stabilný aj s rastúcim prijatím?

  • Dochádza k zásahom človeka na správnych miestach?

Zodpovedajúce dvojice sa môžu posunúť k týmto ukazovateľom:

  • náklady na interakciu ↔ vyhodnotená kvalita výstupu;

  • šírka prijatia ↔ hĺbka používania; a

  • miera automatizácie ↔ vystavenie prevádzkovému riziku.

Počiatočné metriky nemusia byť nesprávne. Odpovedajú na otázky, ktoré boli dôležité v skoršej fáze.

Riziko vzniká pri prechode medzi fázami. Pilotné metriky často pretrvávajú, pretože ich tímy vedia vykazovať a nikto nezodpovedá za rozhodnutie prestať ich používať. Ukazovatele, ktoré kedysi podporovali učenie, sa môžu postupne zmeniť na márnivé metriky.

Aj dvojice by preto mali mať svoj životný cyklus. Tímy by ich mali zaviesť pre konkrétne rozhodnutie, pravidelne overovať, či naďalej odhaľujú podstatný kompromis, a prestať ich používať, keď sa produkt alebo rozhodnutie zmení.

Monitorovanie a rozhodovanie sú odlišné vrstvy

Systémy AI si vyžadujú podrobnú pozorovateľnosť, upozorňovanie, zabezpečenie kvality a vyhodnocovanie. Odstránenie týchto signálov by sťažilo bezpečnú prevádzku produktu. Prevádzkové monitorovanie však nie je to isté ako meranie pre potreby vedenia.

Monitorovanie pomáha tímom odhaľovať incidenty, sledovať príčiny zlyhaní a chápať správanie systému. Rozhodovacie metriky pomáhajú produktovým a obchodným lídrom rozhodovať, či investovať, zasiahnuť, zmeniť smer alebo prijať kompromis.

Organizácia môže sledovať stovky technických a prevádzkových signálov, no pri konkrétnom rozhodnutí o produkte uprednostniť iba dve či tri vzájomne protichodné dvojice. Ak táto rozhodovacia vrstva zostane malá, určovanie priorít je jednoduchšie.

Vhodná frekvencia kontrol závisí od produktu. Nový alebo rýchlo sa meniaci systém si môže vyžadovať týždenné kontroly rozhodnutí, zatiaľ čo pri zrelom produkte môžu stačiť mesačné alebo štvrťročné kontroly. Dôležitejší než interval je princíp: dvojicu kontrolujte dosť často na to, aby ste mohli zasiahnuť skôr, než sa kompromis stane nákladným alebo nebezpečným.

Určte, akú reakciu má dvojica vyvolať

Dvojica začne byť užitočná, až keď sa organizácia dohodne, čo urobí v prípade jej zhoršenia.

Nestačí pritom iba určiť kritickú hranicu odchýlky. Tímy by mali zvážiť tri situácie:

  • Absolútne zlyhanie: jeden ukazovateľ prekročí neprijateľnú hranicu bez ohľadu na druhý.

  • Odchýlka: jeden ukazovateľ sa zlepšuje, zatiaľ čo jeho protiváha sa zhoršuje.

  • Spoločné zhoršenie: obe strany klesajú, čo naznačuje širší problém produktu alebo prevádzky.

Každá dvojica by mala mať:

  • určeného vlastníka;

  • jasné rozhodnutie, ktoré podporuje;

  • dohodnuté prahové hodnoty alebo hodnotiace kritériá;

  • postup vyšetrovania; a

  • súbor možných zásahov.

Bez týchto prvkov organizácia produkt iba pozoruje, namiesto toho, aby ho riadila.

Päť otázok na najbližšiu kontrolu metrík

Skôr než pridáte ďalší ukazovateľ, vyberte jedno dôležité rozhodnutie o produkte a prejdite si nasledujúce otázky. Odpovede si zapíšte, aby sa kontrola skončila dohodou na ďalšom kroku.

1. Pri ktorom rozhodnutí nám majú tieto metriky pomôcť?

Buďte konkrétni: rozhodujete sa, či rozšíriť automatizáciu, zmeniť model alebo zlepšiť odovzdanie človeku? Najprv pomenujte rozhodnutie, až potom vyberte ukazovatele.

2. Čo by sa mohlo zhoršiť, ak sa toto číslo zlepší?

Určte výsledok, ktorý potrebujete chrániť, a ukazovateľ, ktorý by odhalil negatívny dosah. Napríklad spojte náklady na interakciu s vyhodnotenou kvalitou výstupu, aby ste overili, či sú lacnejšie odpovede naďalej užitočné.

3. Čo môžu hlavné čísla skrývať?

Oba ukazovatele vyhodnoťte pri rovnakých používateľoch, úlohách a období a potom hľadajte skupiny s horšími výsledkami. Zvážte aj východiskovú situáciu: nízka spokojnosť môže odrážať frustráciu, ktorá vznikla ešte pred interakciou s podporou.

4. Čo nás prinúti konať a kto zodpovedá za reakciu?

Určte kritériá zásahu pre prípady, keď ukazovateľ prekročí neprijateľnú hranicu, jeden sa zlepší a druhý zhorší alebo sa zhoršia oba. Dohodnite sa, kto situáciu preskúma, čo skontroluje ako prvé a kedy podá správu.

5. Zodpovedá táto dvojica stále aktuálnej fáze produktu?

Rozhodnite, či ju ponecháte, nahradíte alebo prestanete používať. Pilotná fáza sa môže zameriavať na spoľahlivosť úloh a dôveru používateľov; fungujúca služba si môže vyžadovať dôkladnejšie sledovanie nákladov a kvality. Stanovte dátum opätovného posúdenia tejto voľby.

Meranie produktov AI by nemalo iba opisovať ich výkon. Malo by odhaľovať kompromisy, ktoré organizácia robí, a objasniť ďalšie rozhodnutie.

Autori

Ale Zacarias a Josie Steer