Navigimi kryesor

Monitorimi i ndikimit të kompromiseve gjatë ndërtimit të produkteve me IA

Ekspozimi i kompromiseve të fshehura i ndihmon ekipet të diagnostikojnë dështimet e produkteve me IA dhe të marrin vendime më të mira.

Përfundimet kryesore

  • Shtimi i metrikave nuk e përmirëson domosdoshmërisht të kuptuarit. Shumë panele përmbajnë disa matje të së njëjtës sjellje bazë. Metrikat bëhen më diagnostikuese kur kombinohen në çifte që kundërveprojnë ndaj njëri-tjetrit: kostoja me cilësinë, zgjidhja pa transferim te njerëzit me perceptimin e klientëve ose saktësia me vonesën.

  • Çiftet e duhura ndryshojnë ndërsa një produkt me IA-në kalon nga faza pilot në prodhim. Matja duhet të ndjekë vendimet që ekipi duhet të marrë në çdo fazë.

  • Monitorimi operacional dhe matja strategjike shërbejnë për qëllime të ndryshme. Ekipet mund të gjurmojnë qindra sinjale të sistemit ndërkohë që përdorin vetëm disa çifte për të udhëzuar në lidhje me vendimet për produktin.

Metrikat kryesore mund të tregojnë një histori bindëse ndërkohë që e lënë të pazgjidhur një vendim të rëndësishëm për produktin.

Asistenti me IA i Klarna ishte lidhur në mënyrë publike me kapacitet më të lartë përpunimi, kosto më të ulëta dhe rezultate të kënaqësisë së klientëve të krahasueshme me ato të agjentëve njerëzorë. Vitin pasues, kompania vendosi të rriste qasjen te mbështetja njerëzore, ndërsa drejtori i saj ekzekutiv pranoi se i ishte vënë një theks shumë i lartë uljes së kostove.

Ky nuk ishte një refuzim i asistentit me IA apo i teknologjisë mbi të cilën ai bazohet. Ishte një përshtatje e ekuilibrit mes automatizimit dhe shërbimit njerëzor, ndërsa kompania nxirrte mësime nga përdorimi i produktit. Ndërsa automatizimi mori përsipër një pjesë më të madhe të kërkesave të thjeshta dhe me volum të lartë, agjentët njerëzorë që i nevojiteshin Klarnas ishin ata të aftë për të trajtuar raste komplekse dhe delikate.

Më shumë metrika nuk sjellin gjithmonë më shumë qartësi

Pasi kanë përcaktuar që në fillim se çfarë duhet të arrijë produkti, shumica e organizatave që ndërtojnë produkte me IA do të përballen përfundimisht me të njëjtën pyetje: a funksionon vërtet?

Nëse përgjigjja nuk është e qartë, instinkti është të shtosh më shumë metrika. Tri metrika bëhen 10, pastaj 10 bëhen 30. Paneli pasurohet, por ekipi mund të mos e kuptojë më mirë situatën.

Problemi nuk qëndron gjithmonë te cilësia e matjeve individuale, por te marrëdhënia mes tyre. Kënaqësia e klientëve, rezultati neto i promovuesve, komentet dhe përqindja e pëlqimeve mund të japin sinjale të dobishme, por mund të pasqyrojnë ndryshime të ngjashme në perceptimin e përgjithshëm. Kur lëvizin së bashku, ato konfirmojnë se diçka ka ndodhur, pa shpjeguar domosdoshmërisht arsyen.

Për këtë arsye, ekipet e IA-së duhet të shikojnë përtej metrikave që përputhen mes tyre dhe të identifikojnë matje që zbulojnë rezultate konkurruese. Këto çifte që kundërveprojnë ndaj njëri-tjetrit zbulojnë dhe ndihmojnë në monitorimin e ndikimit të kompromiseve në performancën e produktit, duke lejuar marrjen e vendimeve më të mira.

Monitorimi i kompromiseve gjatë ndërtimit të agjentëve zanorë në kohë reale: kur metrikat shtesë nuk ndihmojnë më

Në një zbatim para hedhjes në treg, ekipi i përbashkët po zhvillonte një agjent zanor me IA në kohë reale për telefonatat hyrëse të mbështetjes së klientëve. Një nga pyetjet më të vështira nuk lidhej me përzgjedhjen e modelit apo orkestrimin. Pyetja ishte se si do ta dinte organizata nëse produkti po funksiononte pasi klientët të fillonin ta përdornin në shkallë të gjerë.

Kuadri fillestar përdorte tri matje:

  • Norma e zgjidhjes pa transferim te njerëzit: sa shpesh IA-ja e zgjidh çështjen në një telefonatë pa ia transferuar një personi.

  • Norma e përshkallëzimit: sa shpesh një telefonatë i transferohet një agjenti njerëzor.

  • Norma e zgjidhjes: sa shpesh zgjidhet përfundimisht problemi i klientit.

Çdo matje ishte e arsyeshme. Megjithatë, së bashku ato nuk mund t’i përgjigjeshin një pyetjeje të qartë: nëse përshkallëzimi rritet, çfarë na tregon kjo?

Ekipi e ndau përshkallëzimin në tetë nëntipa. Më pas shtoi matje të braktisjes, rrugëtimit dhe kohës, rezultate të të kuptuarit të gjuhës dhe zgjidhjen sipas llojit të kërkesës. Në fund, kuadri përmbante 31 metrika në gjashtë kategori.

Ai mund ta përshkruante në detaje përshkallëzimin, por nuk mund ta diagnostikonte ende në mënyrë të sigurt shkakun e tij. Shumica e metrikave ishin variante të së njëjtës sjellje, kështu që lëviznin së bashku në vend që të testonin shpjegime konkurruese.

Paneli ishte bërë përshkrues, jo diagnostikues.

Përdor çifte që kundërveprojnë ndaj njëri-tjetrit për të zbuluar kompromiset

Ekipit nuk i nevojitej një tjetër nivel zbërthimi, por metrika që kufizonin njëra-tjetrën.

Ne i quajmë këto çifte që kundërveprojnë ndaj njëri-tjetrit: dy matje ku përmirësimi i njërës në mënyrë të izoluar mund të dëmtojë rezultatin që përfaqëson tjetra. Emri përshkruan mënyrën e dështimit që krijon optimizimi i njëanshëm, jo gjendjen e dëshiruar.

Kur të dyja anët mbeten në gjendje të mirë, produkti mund të funksionojë në mënyrë të qëndrueshme. Kur ato ndryshojnë në drejtime të kundërta, drejtimi i këtij devijimi e ndihmon ekipin të vendosë se ku duhet të hetojë.

Çfarë kishim

Çifti që kundërvepron ndaj njëri-tjetrit

Çfarë mund të zbulojë çifti

Norma e përshkallëzimit e ndarë në tetë nëntipa

Norma e përshkallëzimit ↔ koha deri në përshkallëzim

Përshkallëzimi i menjëhershëm mund të tregojë problem me besimin ose kuadrin; përshkallëzimi i mëvonshëm mund të tregojë se sistemi nuk mund ta përfundojë detyrën.

Norma e zgjidhjes pa transferim te njerëzit dhe norma e zgjidhjes të raportuara veçmas

Norma e zgjidhjes pa transferim te njerëzit ↔ perceptimi i klientit

Nëse zgjidhja pa transferim te njerëzit përfaqëson një zgjidhje të kënaqshme apo braktisjen e përpjekjes nga klienti.

Norma e zgjidhjes sipas llojit të synimit

Norma e zgjidhjes ↔ thellësia e bisedës

Nëse zgjidhja e suksesshme është efikase apo kërkon një ndërveprim rraskapitës.

Për të shikuar në më thellësi se si zbulohet kjo dhe si duhet përdorur kjo njohuri, le të marrim parasysh normën e përshkallëzimit dhe kohën deri në përshkallëzim. Ekipi nuk do ta dijë si sillen klientët derisa të marrin telefonatat reale, por mund të përcaktojë hipotezat që duhet të testohen.

Nëse më shumë telefonata fillojnë të përshkallëzohen dhe klientët largohen nga përvoja me IA brenda 30 sekondave të para, ekipi duhet të hetojë besimin, transparencën, tonin dhe ndërveprimet fillestare. Nëse klientët i përshkallëzojnë pasi kanë kaluar disa minuta duke u përpjekur të kryejnë një detyrë, problemi më i mundshëm bëhet aftësia ose mbulimi i fluksit të punës.

Shifra kryesore e përshkallëzimit është e njëjtë. Vendimi për produktin është i ndryshëm.

Një çift i dobishëm nuk e vërteton vetë shkakun. Ai e ngushton hetimin dhe e bën më të qartë vendimin e ardhshëm.

Kostoja dhe cilësia duhen lexuar së bashku

Shembulli i Klarna, i paraqitur më herët, tregon si zbatohet ky parim kur ndërveprojnë kostoja dhe cilësia e shërbimit. Ai tregon se si një model përdorimi i mundësuar nga IA-ja mund të zhvillohet ndërkohë që kompania monitoron ndikimin e kompromiseve dhe mëson nga zbatimi i tij.

Në shkurt 2024, kompania raportoi se asistenti i saj me IA kishte trajtuar 2,3 milionë biseda gjatë muajit të parë, kishte kryer punë të barasvlershme me atë të 700 agjentëve me kohë të plotë dhe kishte arritur rezultate të kënaqësisë së klientëve të krahasueshme me ato të agjentëve njerëzorë. Klarna vlerësoi se asistenti do të sillte një përmirësim të fitimit prej 40 milionë dollarësh gjatë vitit 2024. Këto ishin rezultate të raportuara nga vetë Klarna, jo një vlerësim i pavarur.

Në maj 2025, drejtori ekzekutiv i Klarna tha se kompania i kishte kushtuar shumë rëndësi uljes së kostove në shërbimin ndaj klientit dhe përshkroi planet për të zgjeruar qasjen te mbështetja njerëzore. Kjo përfaqësonte një rregullim të ekuilibrit mes shërbimit të automatizuar dhe atij njerëzor, jo refuzim të asistentit me IA apo të teknologjisë së tij bazë.

Dëshmitë publike tregojnë pse matjet e efikasitetit duhen shqyrtuar së bashku me nevojat e klientëve dhe ndërveprimeve të ndryshme. Një sistem i IA-së mund të ketë mesatarisht performancë të mirë, ndërkohë që disa raste komplekse, delikate ose të pazakonta vazhdojnë të përfitojnë nga një kanal i arritshëm shërbimi nga njerëzit.

Monitorimi i të dyja anëve të kësaj marrëdhënieje e ndihmon kompaninë të vendosë ku krijon vlerë automatizimi, ku mbetet e rëndësishme mbështetja njerëzore dhe si duhet të ndryshojë ekuilibri me shfaqjen e mëtejshme të dëshmive të reja.

Çifte të tjera që kundërveprojnë ndaj njëri-tjetrit në produktet me IA mund të përfshijnë si më poshtë:

Çifti që kundërvepron ndaj njëri-tjetrit

Rreziku që ndihmon të zbulohet

Saktësia e përgjigjes ↔ vonesa e përgjigjes

Një sistem që është teknikisht i saktë, por tepër i ngadaltë për fluksin e punës.

Përfundimi i detyrës ↔ norma e ndërhyrjes së përdoruesit

Një fluks pune me IA që përfundon detyra që përdoruesit i ribëjnë vazhdimisht.

Kostoja për ndërveprim ↔ cilësia e vlerësuar e rezultatit

Kursime të arritura duke përkeqësuar përvojën e klientit ose punonjësit.

Adoptimi ↔ koha deri në krijimin e vlerës

Rritje e regjistrimeve pa vlerë përkatëse për përdoruesin.

Qëllimi nuk është që të dyja matjet të rriten pafundësisht. Qëllimi është që kompromisi të bëhet i dukshëm para se optimizimi i njëanshëm të krijojë një problem operativ.

Pika e nisjes e klientit ndryshon kuptimin e një metrike

Një sfidë e ngjashme u shfaq gjatë zbatimit të mbështetjes së lojtarëve për një kompani lojërash për celularë. Sistemi trajtonte problemet me volum të lartë, si humbja e progresit, mosmarrëveshjet për pagesat dhe qasja në llogari.

Matjet e efikasitetit kishin rëndësi sepse sistemi funksiononte në shkallë të gjerë. Por mbështetja e lojtarëve nuk është thjesht një radhë operative. Lojtarët shpesh mbërrijnë të pakënaqur sepse diçka ka shkuar keq më herët në përvojën e tyre.

Kjo pikënisje ndryshon mënyrën si duhen interpretuar të dhënat për kënaqësinë e klientëve. Një lojtar, problemi i të cilit zgjidhet siç duhet, mund të raportojë përsëri kënaqësi të ulët sepse humbi progresin në radhë të parë. Leximi i këtij rezultati pa kontekst mund ta penalizojë ndërveprimin me ekipin e mbështetjes për pakënaqësinë e krijuar më herët gjatë rrugëtimit të klientit.

Për këtë arsye, ekipi duhej të dallonte midis perceptimit fillestar të klientit nga efekti i përvojës me mbështetjen. Pyetja më e dobishme nuk ishte: “A ishte i kënaqur lojtari?”, por “A e përmirësoi ndërveprimi situatën krahasuar me pikën ku e filloi lojtari?”

Ky krahasim mund të ndihmojë në ndarjen e pakënaqësisë me produktin nga cilësia e mbështetjes, me kusht që ekipi të ketë një mënyrë të besueshme për t’i matur të dyja.

Matja duhet të ndryshojë bashkë me produktin

Produktet me IA ndryshojnë, por metrikat e tyre shpesh mbeten të pandryshuara.

Gjatë fazës pilot, pyetja kryesore mund të jetë nëse sistemi është mjaft i besueshëm për të justifikuar investime të mëtejshme:

  • A e përfundon në mënyrë të besueshme detyrën kryesore?

  • A kanë përdoruesit besim të mjaftueshëm për të vazhduar?

  • Si sillet jashtë skenarëve më të zakonshëm?

  • A mund të identifikohen dështimet dhe të rikuperohen në mënyrë të sigurt?

Këto pyetje favorizojnë çifte të tilla si:

  • suksesi në detyrën kryesore ↔ performanca në rastet e pazakonta;

  • norma e automatizimit ↔ norma e ndërhyrjes njerëzore; dhe

  • shpejtësia e përfundimit ↔ besimi i përdoruesit.

Pasi produkti bëhet i rëndësishëm nga ana operative, pyetjet ndryshojnë:

  • A mund të zgjerohet shkalla pa ulur cilësinë?

  • A përmirësohet ekonomia e tij me përdorimin?

  • A mbetet e qëndrueshme performanca ndërkohë që rritet adoptimi?

  • A po ndodhin ndërhyrjet njerëzore në vendet e duhura?

Çiftet përkatëse mund të zhvendosen drejt:

  • kostos për ndërveprim ↔ cilësisë së vlerësuar të rezultatit;

  • gjerësisë së adoptimit ↔ thellësisë së përdorimit; dhe

  • normës së automatizimit ↔ ekspozimit ndaj rrezikut operacional.

Metrikat e hershme nuk janë domosdoshmërisht të gabuara. Ato u përgjigjen pyetjeve që kishin rëndësi në një fazë më të hershme.

Rreziku shfaqet gjatë fazës së kalimit. Metrikat e fazës pilot shpesh ruhen sepse ekipet dinë si t’i raportojnë dhe askush nuk e ka përgjegjësinë për të vendosur heqjen e tyre nga funksionimi. Matjet që dikur mbështetnin të mësuarit mund të shndërrohen gradualisht në metrika të pavlefshme.

Për këtë arsye, çiftet duhet të kenë një cikël jete. Ekipet duhet t’i përdorin për një vendim të përcaktuar, të rishikojnë nëse vazhdojnë të zbulojnë një kompromis të rëndësishëm dhe t’i heqin nga funksionimi kur produkti ose vendimi ndryshon.

Monitorimi dhe vendimmarrja janë shtresa të ndryshme

Sistemet e IA-së kërkojnë një mundësi vrojtimi të detajuar, sinjalizime, sigurim të cilësisë dhe vlerësim. Heqja e këtyre sinjaleve do ta bënte më të vështirë përdorimin e produktit në mënyrë të sigurt. Por monitorimi operacional nuk është i njëjtë me matjen për drejtuesit.

Monitorimi i ndihmon ekipet të zbulojnë incidentet, të gjurmojnë dështimet dhe të kuptojnë sjelljen e sistemit. Metrikat e vendimmarrjes i ndihmojnë drejtuesit e produktit dhe biznesit të vendosin nëse duhet të investojnë, të ndërhyjnë, të ndryshojnë drejtimin apo të pranojnë një kompromis.

Një organizatë mund të monitorojë qindra sinjale teknike dhe operacionale ndërkohë që thekson vetëm dy ose tri çifte që kundërveprojnë ndaj njëri-tjetrit për një vendim të caktuar mbi produktin. Kufizim i kësaj shtrese të vendimmarrjes e bën më të lehtë përcaktimin e prioriteteve.

Shpeshtësia e duhur e rishikimit varet nga produkti. Një sistem i ri ose që ndryshon shpejt mund të kërkojë rishikime javore të vendimeve, ndërkohë që për një produkt të konsoliduar mund të mjaftojnë rishikime mujore ose tremujore. Parimi është më i rëndësishëm se intervali: rishikoje çiftin aq shpesh sa të veprosh para se kompromisi të bëhet i kushtueshëm ose i pasigurt.

Përcakto se çfarë veprimi duhet të aktivizojë çifti

Një çift bëhet i dobishëm vetëm kur organizata bie dakord se çfarë do të ndodhë nëse ai përkeqësohet.

Kjo kërkon më shumë sesa përcaktimi i një vije të kuqe për devijimin. Ekipet duhet të marrin parasysh tri kushte:

  • Dështim absolut: njëra matje kalon një prag të papranueshëm, pavarësisht tjetrës.

  • Devijim: njëra matje përmirësohet, ndërsa kundërpesha e saj përkeqësohet.

  • Përkeqësim i përbashkët: të dyja anët përkeqësohen, gjë që sugjeron një problem më të gjerë me produktin ose përdorimin.

Çdo çift duhet të ketë:

  • një përgjegjës të përcaktuar;

  • një vendim të qartë të mbështetur;

  • pragje ose kritere të miratuara vlerësimi;

  • një proces hetimi; dhe

  • një grup ndërhyrjesh të mundshme.

Pa këto elemente, organizata po e vëzhgon produktin në vend që ta menaxhojë atë.

Pesë pyetje për rishikimin e radhës të metrikave

Para se të shtosh një matje tjetër, zgjidh një vendim të rëndësishëm për produktin dhe rishiko këto pyetje. Shkruaj përgjigjet në mënyrë që rishikimi të përfundojë me një hap vijues të miratuar.

1. Për marrjen e cilit vendim duhet të na ndihmojnë këto metrika?

Tregohu specifik: po vendosim nëse duhet të zgjerojmë automatizimin, të ndryshojmë një model apo të përmirësojmë transferimin te një person? Përcakto vendimin para se të zgjedhësh matjet.

2. Nëse ky numër përmirësohet, çfarë mund të përkeqësohet?

Identifiko rezultatin që duhet të mbrosh dhe një matje që do të zbulonte dëmin. Për shembull, çifto koston për ndërveprim me cilësinë e vlerësuar të rezultatit për të kontrolluar nëse përgjigjet më të lira janë ende të dobishme.

3. Çfarë mund të fshehin shifrat kryesore?

Lexo të dyja matjet për të njëjtët përdorues, detyra dhe periudhë kohore dhe më pas kërko për grupe që kanë rezultate më të ulëta. Ki parasysh kushtet fillestare po ashtu: kënaqësia e një niveli të ulët mund të pasqyrojë pakënaqësi që ka ekzistuar para ndërveprimit me ekipin e mbështetjes.

4. Çfarë do të na shtynte të vepronim dhe kush është përgjegjës për reagimin?

Përcakto kriteret për veprimin kur një matje kalon një kufi të papranueshëm, njëra përmirësohet ndërsa tjetra përkeqësohet ose të dyja ulen. Prano se kush do të hetojë, çfarë do të kontrollojë në fillim dhe kur do të raportojë.

5. A i përshtatet ende ky çift fazës aktuale të produktit?

Vendos nëse duhet ta mbash, zëvendësosh apo heqësh nga funksionimi. Një fazë pilot mund të përqendrohet te besueshmëria e detyrës dhe besimi i përdoruesit; një shërbim aktiv mund të kërkojë shqyrtim më të detajuar të kostos dhe cilësisë. Cakto një datë për të rishikuar zgjedhjen.

Matja e produkteve me IA duhet të bëjë më shumë sesa të përshkruajë performancën. Ajo duhet të zbulojë kompromiset që bën organizata dhe ta bëjë më të qartë vendimin e radhës.

Authors

Ale Zacarias, Josie Steer