Fő navigáció

A kompromisszumok hatásának monitorozása AI-termékek fejlesztésekor

A rejtett kompromisszumok feltárása segít a csapatoknak az AI-termékek hibáinak diagnosztizálásában és a jobb döntések meghozatalában.

Vezetői összefoglaló

  • Több mérőszám nem feltétlenül jelent jobb megértést. Sok irányítópulton több mérőszám is ugyanazt a mögöttes viselkedést méri. A mérőszámok pontosabb diagnózist tesznek lehetővé, ha kölcsönösen romboló párokba rendezzük őket: költség és minőség, automatizált ügykezelés és ügyfélhangulat, illetve pontosság és késleltetés.

  • A megfelelő párok változnak, ahogy egy AI-termék a kísérleti fázisból éles üzembe kerül. A mérést azokhoz a döntésekhez kell igazítani, amelyeket a csapatnak az egyes szakaszokban meg kell hoznia.

  • Az operatív monitorozás és a stratégiai mérés eltérő célokat szolgál. A csapatok rendszerjelek százait követhetik, miközben a termékdöntésekhez csak néhány mérőszámpárt használnak.

A kiemelt mérőszámok meggyőző képet festhetnek, miközben egy fontos termékdöntést megválaszolatlanul hagynak.

A Klarna AI-asszisztensét a nyilvánosságban nagyobb adatátviteli egységgel, alacsonyabb költségekkel és az emberi ügynökökéhez hasonló ügyfél-elégedettségi mutatókkal hozták összefüggésbe. A következő évben a vállalat úgy döntött, szélesebb körben teszi elérhetővé az emberi támogatást; vezérigazgatója elismerte, hogy túl nagy hangsúlyt helyeztek a költségcsökkentésre.

Ez nem az AI-asszisztens vagy az alapjául szolgáló technológia elutasítását jelentette. A vállalat a termék működtetése során szerzett tapasztalatok alapján módosította az automatizálás és az emberi kiszolgálás egyensúlyát. Ahogy az automatizálás egyre nagyobb volumenű, egyszerűbb ügyet vett át, a Klarna számára olyan ügyintézőkre volt szükség, akik képesek voltak a bonyolult, kényes ügyek kezelésére.

A több mérőszám nem mindig ad tisztább képet

Miután már a kezdetektől meghatározták, mit kell elérnie a terméknek, az AI-termékeket fejlesztő szervezetek többsége előbb-utóbb ugyanazzal a kérdéssel szembesül: valóban működik?

Ha a válasz nem egyértelmű, az első ösztönös reakció gyakran további mérőszámok bevezetése. A háromból 10, majd a 10-ből 30 lesz. Az irányítópult egyre gazdagabb, de a csapat nem feltétlenül érti jobban a helyzetet.

A probléma nem mindig az egyes mérőszámok minősége, hanem a köztük lévő kapcsolat. Az ügyfél-elégedettség, a Net Promoter Score, az értékelések és a pozitív visszajelzések aránya mind hasznos jelzéseket adhat, de gyakran ugyanazokat az általános hangulatváltozásokat tükrözik. Ha együtt változnak, megerősítik, hogy történt valami, de nem feltétlenül magyarázzák meg az okát.

Az AI-csapatoknak ezért túl kell tekinteniük az egymást megerősítő mérőszámokon, és olyanokat kell keresniük, amelyek egymással versengő eredményeket tárnak fel. Ezek a kölcsönösen romboló párok feltárják és nyomon követhetővé teszik a termékteljesítmény mögötti kompromisszumok hatását, így jobb döntéseket tesznek lehetővé.

Kompromisszumok monitorozása valós idejű hangalapú ügynökök fejlesztésekor: amikor a több mérőszám már nem segített

Egy éles indulás előtti projektben a közös csapat valós idejű AI-hangügynököt fejlesztett a bejövő ügyfélszolgálati hívások kezelésére. Az egyik legnehezebb kérdés nem a modell kiválasztásáról vagy az összehangolásról szólt. Hanem arról, honnan tudja majd a szervezet, hogy működik-e a termék, amikor az ügyfelek nagy léptékben használni kezdik.

A kezdeti keretrendszer három mérőszámot használt:

  • Automatizált ügykezelési arány: milyen gyakran oldja meg az AI a hívást anélkül, hogy emberhez irányítaná.

  • Eszkalációs arány: milyen gyakran irányítják át a hívást emberi ügynökhöz.

  • Megoldási arány: milyen gyakran sikerül végül megoldani az ügyfél problémáját.

Mindegyik mérőszám észszerű volt. Együtt azonban nem tudtak megválaszolni egy nyilvánvaló kérdést: ha nő az eszkaláció, mit árul el ez?

A csapat nyolc altípusra bontotta az eszkalációt. Ezután bevezette a megszakítási, ügyfélút- és időzítési mutatókat, a nyelvértési pontszámokat, valamint a lekérdezéstípusonkénti megoldási arányt. A keretrendszer végül hat kategóriában 31 mérőszámot tartalmazott.

Részletesen le tudta írni az eszkalációt, de az okát továbbra sem tudta megbízhatóan feltárni. A legtöbb mérőszám ugyanannak a viselkedésnek egy-egy változata volt, ezért együtt mozogtak ahelyett, hogy egymással versengő magyarázatokat teszteltek volna.

Az irányítópult diagnosztikai helyett pusztán megfigyelő eszközzé vált.

Kölcsönösen romboló párokkal tárjuk fel a kompromisszumokat

A csapatnak nem újabb szintű felbontásra volt szüksége. Olyan mérőszámokra volt szüksége, amelyek korlátot szabnak egymásnak.

Ezeket kölcsönösen romboló pároknak nevezzük: két olyan mérőszámról van szó, amelyek egyikének elszigetelt javítása ronthatja a másik által képviselt eredményt. Az elnevezés az egyoldalú optimalizálás okozta hibamódot írja le, nem a kívánt állapotot.

Ha mindkét oldal egészséges marad, a termék működése fenntartható lehet. Ha eltérnek egymástól, az eltérés iránya segít a csapatnak eldönteni, hol érdemes vizsgálódnia.

Amink volt

Kölcsönösen romboló pár

Mit tárhat fel a pár?

Nyolc altípusra bontott eszkalációs arány

Eszkalációs arány ↔ eszkalációig eltelt idő

Az azonnali eszkaláció bizalmi vagy kommunikációs problémára utalhat; a későbbi eszkaláció azt jelezheti, hogy a rendszer nem tudja elvégezni a feladatot.

Külön jelentett automatizált ügykezelési és megoldási arány

Automatizált ügykezelési arány ↔ ügyfélhangulat

Az automatizált ügykezelés kielégítő megoldást jelent-e, vagy azt, hogy az ügyfél feladta a próbálkozást.

Megoldási arány szándéktípusonként

Megoldási arány ↔ beszélgetés mélysége

A sikeres megoldás hatékony-e, vagy kimerítő interakciót igényel.

Az eltérés feltárásának és a felismerés hasznosításának mélyebb megértéséhez vizsgáljuk meg az eszkalációs arányt és az eszkalációig eltelt időt. A csapat a valós hívások beérkezéséig nem tudhatja, hogyan viselkednek az ügyfelek, de meghatározhatja a tesztelendő hipotéziseket.

Ha több hívást eszkalálnak, és az ügyfelek az első 30 másodpercen belül kilépnek az AI-élményből, a csapatnak a bizalmat, a tájékoztatást, a hangnemet és a nyitó interakciókat kell megvizsgálnia. Ha az ügyfelek egy feladattal több percig próbálkozva kérnek eszkalációt, akkor valószínűbb, hogy a képességek vagy a munkafolyamat lefedettsége okozza a problémát.

A kiemelt eszkalációs szám ugyanaz. A termékdöntés viszont eltérő.

Egy hasznos pár önmagában nem bizonyítja az okot. Leszűkíti a vizsgálatot, és egyértelműbbé teszi a következő döntést.

A költséget és a minőséget együtt kell értelmezni

A korábban bemutatott Klarna-példa megmutatja, hogyan alkalmazható ez az elv, amikor a költség és a szolgáltatás minősége kölcsönhatásba lép. Bemutatja, hogyan fejlődhet egy AI-alapú működési modell, miközben a vállalat monitorozza a kompromisszumok hatását, és tanul a bevezetés tapasztalataiból.

A vállalat 2024 februárjában arról számolt be, hogy AI-asszisztense az első hónapban 2,3 millió beszélgetést kezelt, 700 teljes munkaidős ügynök munkájának megfelelő feladatot végzett, és az emberi ügynökökéhez hasonló ügyfél-elégedettségi eredményeket ért el. A Klarna becslése szerint az asszisztens 2024-ben 40 millió dollárral növelte volna a nyereséget. Ezek a Klarna saját közlései voltak, nem független értékelés eredményei.

A Klarna vezérigazgatója 2025 májusában azt mondta, hogy a vállalat túl nagy hangsúlyt helyezett az ügyfélszolgálati költségek csökkentésére, és ismertette az emberi támogatás elérhetőségének bővítésére vonatkozó terveket. Ez az automatizált és az emberi kiszolgálás egyensúlyának módosítását jelentette, nem pedig az AI-asszisztens vagy az alapjául szolgáló technológia elutasítását.

A nyilvánosan elérhető adatok jól szemléltetik, miért kell a hatékonysági mérőszámokat a különböző ügyfelek és interakciók igényeivel együtt mérlegelni. Egy AI-rendszer átlagosan jól teljesíthet, miközben egyes összetett, érzékeny vagy szokatlan eseteknél továbbra is előnyös lehet egy könnyen elérhető emberi csatorna.

A kapcsolat mindkét oldalának monitorozása segít eldönteni, hol teremt értéket az automatizálás, hol marad fontos az emberi támogatás, és hogyan módosuljon az egyensúly az új eredmények fényében.

Az AI-termékeknél további kölcsönösen romboló párok lehetnek:

Kölcsönösen romboló pár

Az általa feltárható kockázat

Válasz pontossága ↔ válasz késleltetése

Egy műszakilag pontos, de a munkafolyamathoz túl lassú rendszer.

Feladat-végrehajtás ↔ felhasználói felülbírálási arány

Olyan AI-munkafolyamat, amely elvégzi a feladatokat, de a felhasználók rendre újra megcsinálják őket.

Interakciónkénti költség ↔ értékelt kimeneti minőség

Az ügyfél- vagy munkavállalói élmény rontásával elért megtakarítás.

Elterjedtség ↔ érték eléréséig eltelt idő

A regisztrációk számának növekedése az ennek megfelelő felhasználói érték nélkül.

Nem az a cél, hogy mindkét mérőszám a végtelenségig növekedjen. A cél az, hogy a kompromisszum még azelőtt láthatóvá váljon, mielőtt az egyoldalú optimalizálás működési problémát okozna.

Az ügyfél kiindulási helyzete megváltoztatja a mérőszám jelentését

Hasonló kihívás jelentkezett egy mobiljáték-vállalat játékostámogatási rendszerének bevezetésekor. A rendszer olyan nagy volumenű problémákat kezelt, mint az elveszett előrehaladás, a fizetési viták és a fiókhoz való hozzáférés.

A hatékonysági mérőszámok fontosak voltak, mert a rendszer nagy léptékben működött. A játékostámogatás azonban nem egyszerűen egy operatív várólista. A játékosok gyakran már eleve frusztráltan érkeznek, mert az élményük egy másik pontján már történt valami probléma.

Ez a kiindulási helyzet megváltoztatja az ügyfél-elégedettségi adatok értelmezését. Egy játékos még akkor is alacsony elégedettségről számolhat be, ha a problémáját megfelelően megoldották, hiszen eleve elvesztette az addigi előrehaladását. Ha ezt a pontszámot a kontextus nélkül értelmezzük, a támogatási interakciót büntethetjük az ügyfélút egy korábbi szakaszában kialakult frusztrációért.

A csapatnak ezért meg kellett különböztetnie az ügyfél kiindulási hangulatát a támogatási élmény hatásától. A hasznosabb kérdés nem az volt: „Elégedett volt a játékos?”Hanem ez: „Javult-e a helyzet az interakció hatására ahhoz képest, ahonnan a játékos indult?”

Ez az összehasonlítás segíthet elkülöníteni a termék miatti frusztrációt a támogatás minőségétől, feltéve, hogy a csapat mindkettőt megbízhatóan tudja mérni.

A mérésnek együtt kell változnia a termékkel

Az AI-termékek változnak, mérőszámaik azonban gyakran változatlanok maradnak.

Egy kísérleti projekt során a központi kérdés az lehet, hogy a rendszer elég megbízható-e a további befektetés indoklásához:

  • Megbízhatóan elvégzi az alapfeladatot?

  • Eléggé megbíznak benne a felhasználók ahhoz, hogy folytassák?

  • Hogyan viselkedik a leggyakoribb eseteken kívül?

  • Biztonságosan azonosíthatók és kezelhetők a hibák?

E kérdésekhez a következő párok illenek:

  • alapfeladat sikere ↔ teljesítmény szélsőséges esetekben;

  • automatizálási arány ↔ emberi felülbírálási arány; valamint

  • végrehajtási sebesség ↔ felhasználói bizalom.

Amint a termék működési szempontból fontossá válik, a kérdések is megváltoznak:

  • Bővíthető a minőség romlása nélkül?

  • Javul a gazdaságossága a használat növekedésével?

  • Stabil marad a teljesítménye az elterjedés növekedésével?

  • A megfelelő pontokon történnek emberi beavatkozások?

A megfelelő párok a következők felé tolódhatnak el:

  • interakciónkénti költség ↔ értékelt kimeneti minőség;

  • elterjedtség ↔ használat mélysége; valamint

  • automatizálási arány ↔ működési kockázatnak való kitettség.

A korai mérőszámok nem feltétlenül hibásak. Egy korábbi szakaszban fontos kérdésekre adnak választ.

A kockázat az átmenet során jelentkezik. A kísérleti mérőszámok gyakran azért maradnak használatban, mert a csapatok tudják, hogyan jelentsék őket, és senki nem felel a kivezetésükről szóló döntésért. A tanulást egykor segítő mutatók idővel látszatmérőszámokká válhatnak.

A pároknak ezért saját életciklussal kell rendelkezniük. A csapatok egy meghatározott döntés támogatására vezessék be őket, vizsgálják felül, hogy továbbra is lényeges kompromisszumot tárnak-e fel, és vezessék ki őket, amikor a termék vagy a döntés megváltozik.

A monitorozás és a döntéshozatal két külön réteg

Az AI-rendszerek részletes megfigyelhetőséget, riasztásokat, minőségbiztosítást és értékelést igényelnek. E jelek eltávolítása megnehezítené a termék biztonságos üzemeltetését. Az operatív monitorozás azonban nem azonos a vezetői szintű méréssel.

A monitorozás segít a csapatoknak észlelni az incidenseket, visszakövetni a hibákat és megérteni a rendszer viselkedését. A döntési mérőszámok segítenek a termék- és üzleti vezetőknek eldönteni, hogy befektessenek, beavatkozzanak, irányt váltsanak vagy elfogadjanak egy kompromisszumot.

Egy szervezet műszaki és működési jelek százait monitorozhatja, miközben egy adott termékdöntéshez csak két-három kölcsönösen romboló párt emel ki. A döntési réteg szűken tartása megkönnyíti a prioritások kijelölését.

A felülvizsgálat megfelelő gyakorisága a terméktől függ. Egy új vagy gyorsan változó rendszer heti döntési felülvizsgálatot igényelhet, míg egy kiforrott terméknél havi vagy negyedéves ütemezés is elegendő lehet. Az elv fontosabb a gyakoriságnál: elég sűrűn vizsgáljuk felül a párt ahhoz, hogy még azelőtt cselekedhessünk, mielőtt a kompromisszum költségessé vagy veszélyessé válik.

Határozzuk meg, milyen intézkedést váltson ki a pár

Egy pár csak akkor válik hasznossá, ha a szervezet megállapodik arról, mi történjen, ha romlani kezd.

Ehhez nem elég meghatározni az eltérés kritikus határát. A csapatoknak három körülményt kell figyelembe venniük:

  • Abszolút kudarc: az egyik mérőszám elfogadhatatlan küszöbértéket lép át, a másiktól függetlenül.

  • Eltérés: az egyik mérőszám javul, miközben az ellensúlya romlik.

  • Együttes romlás: mindkét oldal romlik, ami átfogóbb termék- vagy működési problémára utal.

Minden párhoz szükséges:

  • egy kijelölt felelős;

  • egy egyértelmű döntés, amelyet támogat;

  • egyeztetett küszöbértékek vagy értékelési szempontok;

  • egy vizsgálati folyamat; valamint

  • lehetséges beavatkozások köre.

Ezek nélkül a szervezet csupán megfigyeli a terméket, ahelyett hogy irányítaná.

Öt kérdés a következő mérőszám-felülvizsgálathoz

Mielőtt újabb mérőszámot vezetnénk be, válasszunk ki egy fontos termékdöntést, és válaszoljuk meg ezeket a kérdéseket. Írjuk le a válaszokat, hogy a felülvizsgálás egy közösen elfogadott következő lépéssel záruljon.

1. Melyik döntés meghozatalában kell segíteniük ezeknek a mérőszámoknak?

Fogalmazzunk pontosan: az automatizálás bővítéséről, egy modell lecseréléséről vagy az embernek történő átadás javításáról döntünk? A mérőszámok kiválasztása előtt nevezzük meg a döntést.

2. Ha ez az érték javul, mi romolhat?

Határozzuk meg a megóvandó eredményt és azt a mérőszámot, amely kimutatná a káros hatást. Például párosítsuk az interakciónkénti költséget az értékelt kimeneti minőséggel, így ellenőrizhetjük, hogy az olcsóbb válaszok továbbra is hasznosak-e.

3. Mit rejthetnek el a kiemelt számok?

Mindkét mérőszámot ugyanazokra a felhasználókra, feladatokra és időszakra vetítve értelmezzük, majd keressük meg azokat a csoportokat, amelyek rosszabb eredményeket tapasztalnak. Vegyük figyelembe a kiindulási helyzetet is: az alacsony elégedettség oka lehet olyan frusztráció, amely már a támogatási interakció előtt fennállt.

4. Mi késztetne minket cselekvésre, és ki felel a reagálásért?

Határozzuk meg a cselekvés feltételeit arra az esetre, ha egy mérőszám elfogadhatatlan határt lép át, az egyik javul, míg a másik romlik, vagy mindkettő romlik. Állapodjunk meg arról, ki vizsgálódik, mit ellenőriz először, és mikor számol be az eredményekről.

5. Továbbra is illik ez a pár a termék jelenlegi szakaszához?

Döntsük el, hogy megtartjuk, lecseréljük vagy kivezetjük. Egy kísérleti projekt a feladatok megbízható elvégzésére és a felhasználói bizalomra összpontosíthat; egy éles szolgáltatásnál a költséget és a minőséget alaposabban kell vizsgálni. Tűzzünk ki időpontot a döntés felülvizsgálatára.

Az AI-termékek mérése nem korlátozódhat a teljesítmény leírására. Fel kell tárnia a szervezet által vállalt kompromisszumokat, és egyértelműbbé kell tennie a következő döntést.

Szerzők

Ale Zacarias és Josie Steer