Hlavní navigace

Sledování dopadů kompromisů při vývoji produktů AI

Odhalení skrytých kompromisů pomáhá týmům diagnostikovat selhání produktů AI a lépe rozhodovat.

Klíčové poznatky pro vedení

  • Přidávání metrik nemusí nutně vést k lepšímu porozumění. Mnohé řídicí panely obsahují několik ukazatelů stejného základního chování. Metriky mají větší diagnostickou hodnotu, když se spojí do vzájemně protichůdných dvojic: náklady s kvalitou, míra vyřešení bez předání se sentimentem nebo přesnost s latencí.

  • Vhodné dvojice se mění s přechodem produktu AI z pilotního provozu do produkce. Měření by mělo vycházet z rozhodnutí, která tým potřebuje v jednotlivých fázích učinit.

  • Provozní monitorování a strategické měření slouží k různým účelům. Týmy mohou sledovat stovky systémových informací, ale produktová rozhodnutí řídit jen několika dvojicemi.

Hlavní metriky mohou působivě vykreslit situaci, a přesto ponechat důležité produktové rozhodnutí nevyřešené.

Asistent AI společnosti Klarna byl veřejně spojován s vyšším výkonem, nižšími náklady a skóre spokojenosti zákazníků srovnatelným s lidskými agenty. Následující rok se společnost rozhodla rozšířit dostupnost lidské podpory a její generální ředitel uznal, že se příliš zdůrazňovalo snižování nákladů.

Nešlo o odmítnutí asistenta AI ani technologie, na níž je založen. Společnost na základě zkušeností z provozu produktu upravila rovnováhu mezi automatizací a lidskou obsluhou. Tím, jak automatizace přebírala stále více jednodušších dotazů ve velkém objemu, potřebovala Klarna lidské agenty schopné řešit složité a citlivé případy.

Více metrik nemusí vždy přinést větší jasno

Jakmile si organizace vyvíjející produkty AI od počátku stanoví, čeho má produkt dosáhnout, nakonec je zpravidla čeká stejná otázka: opravdu funguje?

Pokud odpověď není jasná, přirozenou reakcí bývá přidat další metriky. Ze tří se stane 10 a z 10 pak 30. Řídicí panel nabízí více informací, ale tým nemusí situaci chápat lépe.

Problém nemusí spočívat v kvalitě jednotlivých ukazatelů, ale v jejich vzájemném vztahu. Spokojenost zákazníků, Net Promoter Score, recenze a podíl kladných hodnocení poskytují užitečné signály, mohou však odrážet podobné změny celkového sentimentu. Pokud se mění společně, potvrzují, že se něco stalo, ale nemusí vysvětlovat důvod.

Týmy AI by proto měly hledat nejen metriky, které se navzájem potvrzují, ale také ukazatele odhalující protichůdné výsledky. Tyto vzájemně protichůdné dvojice odhalují a pomáhají sledovat dopad kompromisů ovlivňujících výkon produktu, a umožňují tak lépe rozhodovat.

Sledování kompromisů při vývoji hlasových agentů v reálném čase: Když více metrik přestalo pomáhat

Při jednom nasazení před spuštěním vyvíjel společný tým hlasového agenta AI v reálném čase pro příchozí hovory zákaznické podpory. Jedna z nejtěžších otázek se netýkala výběru modelu ani orchestrace. Šlo o to, jak organizace po zahájení rozsáhlého používání zákazníky pozná, zda produkt funguje.

Počáteční rámec využíval tři ukazatele:

  • Míra vyřešení bez předání: jak často AI vyřeší hovor bez jeho předání člověku.

  • Míra eskalace: jak často je hovor předán lidskému agentovi.

  • Míra vyřešení: jak často se nakonec podaří problém zákazníka vyřešit.

Každý ukazatel dával smysl. Společně však nedokázaly odpovědět na zřejmou otázku: co nám říká nárůst eskalací?

Tým rozdělil eskalace do osmi podtypů. Poté přidal ukazatele opuštění, průběhu a načasování, skóre porozumění jazyku a míru vyřešení podle typu požadavku. Rámec nakonec obsahoval 31 metrik v šesti kategoriích.

Dokázal eskalace podrobně popsat, ale stále neuměl spolehlivě určit jejich příčinu. Většina metrik představovala obměny stejného chování, takže se vyvíjely společně, místo aby ověřovaly konkurenční vysvětlení.

Řídicí panel už sloužil spíše k pozorování než k diagnostice.

Odhalujte kompromisy pomocí vzájemně protichůdných dvojic

Tým nepotřeboval další úroveň rozčlenění. Potřeboval metriky, které se navzájem omezují.

Říkáme jim vzájemně protichůdné dvojice: dva ukazatele, u nichž může izolované zlepšování jednoho poškodit výsledek zachycený druhým. Název popisuje selhání způsobené jednostrannou optimalizací, nikoli žádoucí stav.

Pokud si obě strany vedou dobře, může produkt fungovat udržitelně. Když se začnou rozcházet, směr odchylky týmu napoví, kde hledat příčinu.

Co jsme měli

Vzájemně protichůdná dvojice

Co může dvojice odhalit

Míra eskalace rozdělená do osmi podtypů

Míra eskalace ↔ čas do eskalace

Okamžitá eskalace může signalizovat problém s důvěrou nebo úvodním nastavením; pozdější eskalace může znamenat, že systém nedokáže úkol dokončit.

Míra vyřešení bez předání a míra vyřešení vykazované samostatně

Míra vyřešení bez předání ↔ sentiment zákazníků

Zda vyřešení bez předání znamená uspokojivé řešení, nebo to, že zákazník pokus vzdal.

Míra vyřešení podle typu záměru

Míra vyřešení ↔ hloubka konverzace

Zda je úspěšné vyřešení efektivní, nebo vyžaduje vyčerpávající interakci.

Abychom lépe pochopili, jak se problém projeví a jak tento poznatek využít, podívejme se na míru eskalace a čas do eskalace. Tým nebude vědět, jak se zákazníci zachovají, dokud nezačnou přicházet skutečné hovory, může však předem stanovit hypotézy k ověření.

Pokud se začne eskalovat více hovorů a zákazníci opustí kontakt s AI během prvních 30 sekund, měl by tým prověřit důvěru, informování, tón a úvodní část interakce. Pokud zákazníci eskalují až po několika minutách snahy úkol dokončit, je pravděpodobnějším problémem rozsah schopností nebo pokrytí pracovního postupu.

Hlavní údaj o eskalaci je stejný. Produktové rozhodnutí je však jiné.

Užitečná dvojice sama o sobě příčinu neprokáže. Zúží však oblast šetření a usnadní další rozhodnutí.

Náklady a kvalitu je třeba posuzovat společně

Výše uvedený příklad společnosti Klarna ukazuje, jak tento princip funguje při vzájemném působení nákladů a kvality služeb. Dokládá, jak se může provozní model využívající AI vyvíjet, když společnost sleduje dopad kompromisů a učí se ze svého nasazení.

V únoru 2024 společnost uvedla, že její AI asistent během prvního měsíce vyřídil 2,3 milionu konverzací, odvedl práci odpovídající 700 agentům na plný úvazek a dosáhl skóre spokojenosti zákazníků srovnatelného s lidskými agenty. Klarna odhadovala, že asistent v roce 2024 přispěje ke zvýšení zisku o 40 milionů dolarů. Šlo o výsledky vykázané samotnou společností Klarna, nikoli o nezávislé hodnocení.

V květnu 2025 generální ředitel společnosti Klarna uvedl, že firma při poskytování zákaznické podpory kladla příliš velký důraz na snižování nákladů, a popsal plány na rozšíření dostupnosti lidské podpory. Šlo o úpravu rovnováhy mezi automatizovanou a lidskou obsluhou, nikoli o zavržení AI asistenta nebo technologie, na níž je založen.

Veřejně dostupné údaje ukazují, proč je třeba ukazatele efektivity posuzovat společně s potřebami různých zákazníků a typů interakcí. Systém AI může dosahovat v průměru dobrých výsledků, ale u některých složitých, citlivých či neobvyklých případů je i nadále přínosný snadno dostupný lidský kanál.

Sledování obou stránek tohoto vztahu pomáhá společnosti určit, kde automatizace vytváří hodnotu, kde zůstává důležitá lidská podpora a jak s novými poznatky rovnováhu měnit.

Mezi další vzájemně protichůdné dvojice napříč produkty AI mohou patřit:

Vzájemně protichůdná dvojice

Riziko, které pomáhá odhalit

Přesnost odpovědi ↔ latence odpovědi

Systém, který je technicky přesný, ale pro daný pracovní postup příliš pomalý.

Dokončení úkolu ↔ míra zásahů uživatele

Pracovní postup AI dokončuje úkoly, které uživatelé opakovaně přepracovávají.

Náklady na interakci ↔ hodnocená kvalita výstupu

Úspory dosažené zhoršením zkušenosti zákazníků nebo zaměstnanců.

Přijetí ↔ doba do získání hodnoty

Růst počtu registrací bez odpovídající hodnoty pro uživatele.

Cílem není, aby oba ukazatele rostly donekonečna. Cílem je zviditelnit kompromis dříve, než jednostranná optimalizace způsobí provozní problém.

Výchozí situace zákazníka mění význam metriky

Související problém se objevil při nasazení hráčské podpory pro společnost provozující mobilní hry. Systém řešil velké množství problémů, například ztracený postup ve hře, spory o platby a přístup k účtu.

Ukazatele efektivity byly důležité, protože systém fungoval ve velkém měřítku. Hráčská podpora však není jen provozní fronta požadavků. Hráči často přicházejí frustrovaní, protože už předtím se v jejich prostředí něco pokazilo.

Tento výchozí stav mění způsob interpretace údajů o spokojenosti zákazníků. Hráč, jehož problém byl správně vyřešen, může přesto uvést nízkou spokojenost, protože především přišel o svůj postup ve hře. Posuzování tohoto skóre bez kontextu může nespravedlivě znevýhodnit interakci se zákaznickou podporou kvůli frustraci, která vznikla už dříve v průběhu zákaznické cesty.

Tým proto potřeboval odlišit výchozí sentiment zákazníka od vlivu zkušenosti s podporou. Užitečnější otázka nezněla: „Byl hráč spokojený?“ Zněla: „Zlepšila interakce situaci oproti stavu, ve kterém se hráč nacházel na začátku?“

Toto srovnání může pomoci oddělit frustraci z produktu od kvality podpory, pokud tým dokáže obojí spolehlivě měřit.

Měření by se mělo měnit spolu s produktem

Produkty AI se mění, jejich metriky však často zůstávají stejné.

Během pilotního provozu může být hlavní otázkou, zda je systém natolik důvěryhodný, aby odůvodnil další investice:

  • Dokáže spolehlivě dokončit hlavní úkol?

  • Důvěřují mu uživatelé natolik, aby jej používali dál?

  • Jak se chová mimo nejběžnější scénáře?

  • Lze selhání rozpoznat a bezpečně napravit?

Tyto otázky upřednostňují například dvojice:

  • úspěšnost hlavního úkolu ↔ výkon v okrajových případech;

  • míra automatizace ↔ míra zásahů člověka; a

  • rychlost dokončení ↔ důvěra uživatelů.

Jakmile se produkt stane provozně důležitým, otázky se změní:

  • Lze jej škálovat bez snížení kvality?

  • Zlepšuje se s používáním jeho ekonomika?

  • Zůstává výkon stabilní i s rostoucím přijetím?

  • Dochází k zásahům člověka na správných místech?

Odpovídající dvojice se mohou posunout k těmto ukazatelům:

  • náklady na interakci ↔ hodnocená kvalita výstupu;

  • šíře přijetí ↔ hloubka používání; a

  • míra automatizace ↔ vystavení provozním rizikům.

Počáteční metriky nemusí být nutně chybné. Odpovídají na otázky, které byly důležité v dřívější fázi.

Riziko vzniká při přechodu mezi fázemi. Metriky z pilotního provozu často přetrvávají, protože je týmy umějí vykazovat a nikdo nenese odpovědnost za rozhodnutí je vyřadit. Ukazatele, které dříve podporovaly učení, se mohou postupně změnit v metriky pro efekt.

Také dvojice by proto měly mít svůj životní cyklus. Týmy by je měly zavádět pro konkrétní rozhodnutí, ověřovat, zda stále odhalují významný kompromis, a při změně produktu nebo rozhodnutí je vyřadit.

Monitorování a rozhodování jsou dvě různé vrstvy

Systémy AI vyžadují podrobnou pozorovatelnost, upozorňování, zajišťování kvality a vyhodnocování. Odstranění těchto signálů by ztížilo bezpečný provoz produktu. Provozní monitorování však není totéž co měření pro potřeby vedení.

Monitorování pomáhá týmům odhalovat incidenty, dohledávat selhání a porozumět chování systému. Rozhodovací metriky pomáhají produktovým a obchodním vedoucím rozhodovat, zda investovat, zasáhnout, změnit směr, nebo přijmout kompromis.

Organizace může sledovat stovky technických a provozních signálů, ale pro konkrétní produktové rozhodnutí vyzdvihnout jen dvě či tři vzájemně protichůdné dvojice. Malý počet ukazatelů v rozhodovací vrstvě usnadňuje stanovení priorit.

Vhodná četnost kontrol závisí na produktu. Nový nebo rychle se měnící systém může vyžadovat týdenní kontroly rozhodnutí, zatímco u zavedeného produktu může stačit měsíční či čtvrtletní rytmus. Princip je důležitější než interval: dvojici kontrolujte dostatečně často, abyste mohli zasáhnout dříve, než se kompromis prodraží nebo ohrozí bezpečnost.

Určete, jakou akci má dvojice vyvolat

Dvojice začne být užitečná, až když se organizace dohodne, co se stane při jejím zhoršení.

Nestačí jen stanovit kritickou hranici odchylky. Týmy by měly zvažovat tři situace:

  • Absolutní selhání: jeden ukazatel překročí nepřijatelnou mez bez ohledu na druhý.

  • Odchylka: jeden ukazatel se zlepšuje, zatímco jeho protiváha se zhoršuje.

  • Společné zhoršení: obě strany se zhoršují, což naznačuje širší problém s produktem nebo provozem.

Každá dvojice by měla mít:

  • určenou odpovědnou osobu;

  • jasně vymezené rozhodnutí, které podporuje;

  • dohodnuté prahové hodnoty nebo hodnoticí kritéria;

  • postup šetření a

  • soubor možných zásahů.

Bez těchto prvků organizace produkt pouze pozoruje, místo aby jej řídila.

Pět otázek pro příští kontrolu metrik

Než přidáte další ukazatel, vyberte jedno důležité produktové rozhodnutí a projděte si následující otázky. Odpovědi si zapište, aby kontrola skončila dohodou na dalším kroku.

1. S jakým rozhodnutím nám mají tyto metriky pomoci?

Buďte konkrétní: rozhodujeme, zda rozšířit automatizaci, změnit model, nebo zlepšit předávání člověku? Nejprve pojmenujte rozhodnutí, teprve potom vybírejte ukazatele.

2. Co by se mohlo zhoršit, pokud se toto číslo zlepší?

Určete výsledek, který potřebujete chránit, a ukazatel, který by odhalil újmu. Například spojte náklady na interakci s hodnocenou kvalitou výstupu, abyste ověřili, zda jsou levnější odpovědi stále užitečné.

3. Co mohou hlavní čísla skrývat?

Oba ukazatele posuzujte u stejných uživatelů, úkolů a časového období a poté hledejte skupiny s horšími výsledky. Zohledněte i výchozí stav: nízká spokojenost může odrážet frustraci, která vznikla ještě před kontaktem s podporou.

4. Co nás přiměje jednat a kdo za reakci odpovídá?

Stanovte kritéria pro zásah, když ukazatel překročí nepřijatelnou mez, jeden se zlepší a druhý zhorší nebo se zhorší oba. Dohodněte se, kdo situaci prošetří, co zkontroluje jako první a kdy podá zprávu.

5. Odpovídá tato dvojice stále současné fázi produktu?

Rozhodněte, zda ji ponechat, nahradit, nebo vyřadit. Pilotní provoz se může zaměřovat na spolehlivost úkolů a důvěru uživatelů; ostrý provoz může vyžadovat důkladnější sledování nákladů a kvality. Stanovte datum, kdy volbu znovu posoudíte.

Měření produktů pomocí AI by nemělo výkon pouze popisovat. Mělo by odhalovat kompromisy, které organizace činí, a usnadnit další rozhodnutí.

Autoři

Ale Zacarias, Josie Steer