Pangunahing nabigasyon

Pagsubaybay sa epekto ng mga trade-off sa paggawa ng mga produktong AI

Ang paglalantad sa mga nakatagong trade-off ay tumutulong sa mga team na matukoy ang kabiguan ng mga produktong AI at gumawa ng mas mahuhusay na desisyon.

Mahahalagang punto para sa mga ehekutibo

  • Hindi awtomatikong nagpapahusay ng pag-unawa ang pagdaragdag ng mga sukatan. Maraming dashboard ang may ilang sukatan para sa iisang pinagbabatayang gawi. Mas nakatutulong sa pagtukoy ng problema ang mga sukatan kapag pinagsama bilang mga pares na nagsasalungatan: gastos at kalidad, containment at saloobin, o katumpakan at latency.

  • Nagbabago ang mga tamang pares habang lumilipat ang isang produktong AI mula pilot patungong production. Dapat umayon ang pagsukat sa mga desisyong kailangang gawin ng team sa bawat yugto.

  • Magkaiba ang layunin ng operational monitoring at estratehikong pagsukat. Maaaring subaybayan ng mga team ang daan-daang signal ng system habang iilang pares lamang ang ginagamit upang gabayan ang mga desisyon sa produkto.

Maaaring maglahad ng kapani-paniwalang kuwento ang mga pangunahing sukatan habang hindi pa rin nasasagot ang isang mahalagang desisyon sa produkto.

Iniugnay sa publiko ang AI assistant ng Klarna sa mas mataas na throughput, mas mababang gastos, at mga marka sa kasiyahan ng customer na maihahambing sa mga taong agent. Nang sumunod na taon, nagpasya ang kumpanya na palawakin ang access sa suportang mula sa tao, at kinilala ng punong ehekutibo nito na labis na nabigyang-diin ang pagbabawas ng gastos.

Hindi ito pagtanggi sa AI assistant o sa teknolohiyang pinagbabatayan nito. Pagsasaayos ito sa balanse sa pagitan ng awtomasyon at serbisyo ng tao habang natututo ang kumpanya mula sa pagpapatakbo ng produkto. Habang tinugunan ng awtomasyon ang karamihan sa napakarami, mas simpleng mga tanong, ang mga agent na tao na kinailangan ng Klarna ay iyong mga may kakayahang humawak ng mga komplikado at sensitibong kaso.

Hindi laging nagdudulot ng higit na linaw ang mas maraming sukatan

Matapos tukuyin sa simula pa lamang ang dapat makamit ng produkto, haharap kalaunan ang karamihan ng organisasyong gumagawa ng mga produktong AI sa iisang tanong: talagang gumagana ba ito?

Kung hindi malinaw ang sagot, karaniwang unang naiisip ang magdagdag pa ng mga sukatan. Ang tatlo ay nagiging 10, at ang 10 ay nagiging 30. Mas dumadami ang laman ng dashboard, ngunit maaaring hindi bumuti ang pag-unawa ng team.

Hindi laging kalidad ng bawat sukatan ang problema, kundi ang ugnayan ng mga ito. Maaaring magbigay ng mahahalagang signal ang kasiyahan ng customer, Net Promoter Score, mga review, at thumbs-up rate, ngunit maaaring magkakatulad na pagbabago sa pangkalahatang saloobin ang ipinakikita ng mga ito. Kapag sabay-sabay silang nagbabago, kinukumpirma nilang may nangyari ngunit hindi kinakailangang naipapaliwanag kung bakit.

Kaya dapat tumingin ang mga AI team nang higit pa sa mga sukatan na magkakatugma at tukuyin ang mga sukatan na naglalantad ng magkakasalungat na resulta. Inilalantad at tinutulungang subaybayan ng mga pares na nagsasalungatan ang epekto ng mga trade-off sa performance ng produkto, kaya mas napabubuti ang pagpapasya.

Pagsubaybay sa mga trade-off habang gumagawa ng mga real-time na voice agent: Nang hindi na nakatulong ang mas maraming sukatan

Sa isang deployment bago ang paglulunsad, gumagawa ang pinagsamang team ng real-time na AI voice agent para sa mga papasok na tawag sa customer support. Ang isa sa pinakamahihirap na tanong ay hindi tungkol sa pagpili ng modelo o orchestration. Ang tanong ay kung paano malalaman ng organisasyon kung gumagana ang produkto kapag sinimulan na itong gamitin ng maraming customer.

Tatlong sukatan ang ginamit ng paunang balangkas:

  • Containment rate: gaano kadalas nalulutas ng AI ang isang tawag nang hindi ito inililipat sa tao.

  • Escalation rate: gaano kadalas inililipat sa taong agent ang isang tawag.

  • Fulfilment rate: gaano kadalas ganap na nalulutas ang problema ng customer.

Makatuwiran ang bawat sukatan. Gayunman, kapag pinagsama, hindi nila masagot ang isang malinaw na tanong: kung tumataas ang escalation, ano ang ipinahihiwatig nito?

Hinati ng team ang escalation sa walong subtype. Pagkatapos, nagdagdag ito ng mga sukatan sa abandonment, journey, at timing, mga marka sa pag-unawa ng wika, at fulfilment ayon sa uri ng query. Kalaunan, nagkaroon ang balangkas ng 31 sukatan sa anim na kategorya.

Mailalarawan nito nang detalyado ang escalation, ngunit hindi pa rin nito mapagkakatiwalaang matukoy ang sanhi. Karamihan sa mga sukatan ay mga variation ng iisang gawi, kaya sabay-sabay silang nagbago sa halip na subukan ang magkakatunggaling paliwanag.

Naging mapagmasid na lamang ang dashboard sa halip na makatukoy ng problema.

Gumamit ng mga pares na nagsasalungatan upang ilantad ang mga trade-off

Hindi panibagong antas ng paghahati-hati ang kailangan ng team. Kailangan nito ng mga sukatan na pumipigil sa isa't isa.

Tinatawag namin itong mga pares na nagsasalungatan: dalawang sukatan kung saan ang pagpapahusay sa isa lamang ay maaaring makasira sa resultang kinakatawan ng kabila. Inilalarawan ng pangalan ang uri ng kabiguang dulot ng panig lamang na pag-optimize, hindi ang ninanais na kalagayan.

Kapag nananatiling maayos ang magkabilang panig, maaaring napapanatili ang mahusay na pagpapatakbo ng produkto. Kapag nagkahiwalay ang kanilang direksyon, nakatutulong ang uri ng paglihis upang magpasya ang team kung saan magsisiyasat.

Ang dating mayroon kami

Pares na nagsasalungatan

Ang maaaring ilantad ng pares

Escalation rate na hinati sa walong subtype

Escalation rate ↔ oras bago ang escalation

Maaaring magpahiwatig ng problema sa tiwala o framing ang agarang escalation; maaaring ipahiwatig ng mas huling escalation na hindi makumpleto ng system ang gawain.

Hiwalay na iniulat ang containment rate at fulfilment rate

Containment rate ↔ saloobin ng customer

Kung ang containment ay nangangahulugan ng kasiya-siyang paglutas o pagsuko ng customer sa pagtatangka.

Fulfilment rate ayon sa uri ng layunin

Fulfilment rate ↔ lalim ng pag-uusap

Kung mahusay ang matagumpay na paglutas o nangangailangan ito ng nakapapagod na pakikipag-ugnayan.

Upang mas maunawaan kung paano ito inilalantad at kung ano ang gagawin sa insight na ito, isaalang-alang natin ang escalation rate at oras bago ang escalation. Hindi malalaman ng team kung paano kikilos ang mga customer hangga't wala pang totoong tawag, ngunit maaari nitong tukuyin ang mga hypothesis na kailangang subukan.

Kung mas maraming tawag ang nagsisimulang ma-escalate at umaalis ang mga customer sa karanasan sa AI sa loob ng unang 30 segundo, dapat siyasatin ng team ang tiwala, disclosure, tono, at mga pambungad na interaksiyon. Kung nagpapa-escalate ang mga customer matapos ang ilang minutong pagsubok na gawin ang isang gawain, mas malamang na kakayahan o saklaw ng workflow ang problema.

Pareho ang pangunahing bilang ng escalation. Iba ang desisyon sa produkto.

Hindi kayang patunayan ng isang kapaki-pakinabang na pares ang sanhi nang mag-isa. Pinaiikli nito ang saklaw ng pagsisiyasat at ginagawang mas malinaw ang susunod na desisyon.

Dapat suriin nang magkasama ang gastos at kalidad

Ipinakikita ng naunang halimbawa ng Klarna kung paano naaangkop ang prinsipyong ito kapag magkaugnay ang gastos at kalidad ng serbisyo. Ipinakikita nito kung paano maaaring umunlad ang isang AI-enabled na operating model habang sinusubaybayan ng kumpanya ang epekto ng mga trade-off at natututo mula sa deployment nito.

Noong Pebrero 2024, iniulat ng kumpanya na nakapangasiwa ang AI assistant nito ng 2.3 milyong pag-uusap sa unang buwan, gumawa ng trabahong katumbas ng 700 full-time na agent, at nakamit ang mga marka sa kasiyahan ng customer na maihahambing sa mga taong agent. Tinantiya ng Klarna na makapag-aambag ang assistant ng $40 milyon sa pagtaas ng kita sa 2024. Mga sariling iniulat na resulta ito ng Klarna, hindi isang independiyenteng pagsusuri.

Noong Mayo 2025, sinabi ng punong ehekutibo ng Klarna na labis na binigyang-diin ng kumpanya ang pagbabawas ng gastos sa customer service at inilarawan ang mga planong palawakin ang access sa suportang mula sa tao. Isa itong pagsasaayos sa balanse ng awtomatiko at serbisyong mula sa tao, sa halip na pagtanggi sa AI assistant o sa teknolohiyang pinagbabatayan nito.

Ipinakikita ng pampublikong ebidensiya kung bakit dapat isaalang-alang ang mga sukatan sa kahusayan kasabay ng mga pangangailangan ng iba't ibang customer at interaksiyon. Maaaring mahusay sa pangkalahatan ang isang AI system habang nakikinabang pa rin ang ilang komplikado, sensitibo, o di-karaniwang kaso sa isang madaling ma-access na channel na pinangangasiwaan ng tao.

Ang pagsubaybay sa magkabilang panig ng ugnayang iyon ay tumutulong sa kumpanya na magpasya kung saan lumilikha ng halaga ang automation, saan nananatiling mahalaga ang suporta ng tao, at paano dapat magbago ang balanse habang may bagong ebidensiya.

Maaaring kabilang sa iba pang pares na nagsasalungatan sa mga produktong AI ang:

Pares na nagsasalungatan

Panganib na tinutulungan nitong ilantad

Katumpakan ng sagot ↔ latency ng sagot

Isang system na tumpak sa teknikal na aspeto ngunit masyadong mabagal para sa workflow.

Pagkumpleto ng gawain ↔ antas ng pag-override ng user

Isang AI workflow na kumukumpleto ng mga gawaing paulit-ulit na inuulit ng mga user.

Gastos sa bawat interaksiyon ↔ nasuring kalidad ng output

Mga natipid na nakamit sa pamamagitan ng pagpapahina sa karanasan ng customer o empleyado.

Adoption ↔ oras bago makamit ang halaga

Pagdami ng mga pag-sign up nang walang katumbas na halaga para sa user.

Hindi layunin na patuloy na tumaas nang walang hanggan ang parehong sukatan. Layunin nitong gawing nakikita ang trade-off bago lumikha ng problema sa operasyon ang panig lamang na pag-optimize.

Binabago ng panimulang kalagayan ng customer ang kahulugan ng isang sukatan

Lumilitaw ang isang kaugnay na hamon sa deployment ng player support para sa isang kumpanya ng mobile games. Pinangasiwaan ng system ang napakaraming isyu gaya ng nawalang progreso, mga hindi pagkakaunawaan sa pagbabayad, at access sa account.

Mahalaga ang mga sukatan sa kahusayan dahil malawakan ang operasyon ng system. Ngunit hindi lamang operational queue ang player support. Madalas na dumarating ang mga player na dismayado dahil may nangyari nang mali sa ibang bahagi ng kanilang karanasan.

Binabago ng panimulang kalagayang iyon kung paano dapat bigyang-kahulugan ang data sa kasiyahan ng customer. Maaaring magbigay pa rin ng mababang marka sa kasiyahan ang isang player na nalutas nang tama ang problema dahil nawalan siya ng progreso sa simula pa lamang. Kapag binasa ang markang iyon nang walang konteksto, maaaring maparusahan ang interaksiyon sa support dahil sa pagkadismayang nalikha sa mas naunang bahagi ng customer journey.

Kaya kinailangang ihiwalay ng team ang panimulang saloobin ng customer sa epekto ng karanasan sa support. Ang mas kapaki-pakinabang na tanong ay hindi, “Masaya ba ang player?” Kundi, “Napabuti ba ng interaksiyon ang sitwasyon kumpara sa panimulang kalagayan ng player?”

Makakatulong ang paghahambing na iyon na ihiwalay ang pagkadismaya sa produkto mula sa kalidad ng support, basta may mapagkakatiwalaang paraan ang team upang sukatin ang dalawa.

Dapat magbago ang pagsukat kasabay ng produkto

Nagbabago ang mga produktong AI, ngunit madalas na hindi nagbabago ang mga sukatan ng mga ito.

Sa panahon ng pilot, maaaring ang pangunahing tanong ay kung sapat na mapagkakatiwalaan ang system upang maipagpatuloy ang pamumuhunan:

  • Mapagkakatiwalaan ba nitong nakukumpleto ang pangunahing gawain?

  • Sapat ba ang tiwala ng mga user dito upang magpatuloy?

  • Paano ito kumikilos sa labas ng mga pinakakaraniwang sitwasyon?

  • Matutukoy ba ang mga kabiguan at ligtas bang makababawi mula sa mga ito?

Mas nababagay sa mga tanong na iyon ang mga pares gaya ng:

  • tagumpay sa pangunahing gawain ↔ performance sa mga di-karaniwang kaso;

  • antas ng automation ↔ antas ng pag-override ng tao; at

  • bilis ng pagkumpleto ↔ tiwala ng user.

Kapag naging mahalaga na sa operasyon ang produkto, nagbabago ang mga tanong:

  • Kaya ba nitong lumawak nang hindi bumababa ang kalidad?

  • Bumabuti ba ang economics nito habang ginagamit?

  • Nananatili bang matatag ang performance habang lumalawak ang adoption?

  • Nangyayari ba sa mga tamang lugar ang mga interbensyon ng tao?

Maaaring lumipat ang mga kaukulang pares sa:

  • gastos sa bawat interaksiyon ↔ nasuring kalidad ng output;

  • lawak ng adoption ↔ lalim ng paggamit; at

  • antas ng automation ↔ pagkakalantad sa panganib sa operasyon.

Hindi nangangahulugang mali ang mga naunang sukatan. Sinasagot ng mga iyon ang mahahalagang tanong sa naunang yugto.

Lumilitaw ang panganib sa panahon ng paglipat. Madalas na nagpapatuloy ang mga sukatan sa pilot dahil alam ng mga team kung paano iulat ang mga ito at walang may pananagutan sa pagpapasyang ihinto ang mga ito. Maaaring unti-unting maging mga vanity metric ang mga sukatang dating nakatulong sa pagkatuto.

Kaya dapat may lifecycle ang mga pares. Dapat gamitin ng mga team ang mga ito para sa isang tiyak na desisyon, suriin kung inilalantad pa rin nila ang mahalagang trade-off, at ihinto ang mga ito kapag nagbago ang produkto o desisyon.

Magkaibang antas ang pagsubaybay at pagpapasya

Nangangailangan ang mga AI system ng detalyadong observability, pag-alerto, quality assurance, at pagsusuri. Kung aalisin ang mga signal na iyon, mas magiging mahirap na ligtas na patakbuhin ang produkto. Ngunit hindi katumbas ng pagsukat para sa pamunuan ang operational monitoring.

Tinutulungan ng monitoring ang mga team na tumukoy ng mga insidente, matunton ang mga kabiguan, at maunawaan ang gawi ng system. Tinutulungan ng mga sukatan para sa pagpapasya ang mga lider ng produkto at negosyo na magpasya kung mamumuhunan, makikialam, magbabago ng direksyon, o tatanggap ng trade-off.

Maaaring subaybayan ng isang organisasyon ang daan-daang teknikal at operational na signal habang dalawa o tatlong pares lamang na nagsasalungatan ang itinatampok para sa isang partikular na desisyon sa produkto. Mas madaling magtakda ng priyoridad kapag pinananatiling maliit ang antas na iyon ng pagpapasya.

Nakadepende sa produkto ang naaangkop na dalas ng pagsusuri. Maaaring mangailangan ng lingguhang pagsusuri sa desisyon ang bago o mabilis magbagong system, samantalang maaaring buwanan o kada quarter ito para sa isang ganap nang produkto. Mas mahalaga ang prinsipyo kaysa sa pagitan ng mga pagsusuri: suriin ang pares nang sapat na madalas upang makakilos bago maging magastos o mapanganib ang trade-off.

Tukuyin kung anong aksiyon ang dapat pasimulan ng pares

Nagiging kapaki-pakinabang lamang ang isang pares kapag nagkasundo ang organisasyon sa gagawin kung lumala ito.

Hindi sapat ang pagtatakda lamang ng pulang linya para sa paglihis. Dapat isaalang-alang ng mga team ang tatlong kondisyon:

  • Ganap na kabiguan: lumampas ang isang sukatan sa hindi katanggap-tanggap na threshold, anuman ang isa pa.

  • Paglihis: bumubuti ang isang sukatan habang lumalala ang katapat nitong panimbang.

  • Magkasabay na paglala: bumababa ang magkabilang panig, na nagpapahiwatig ng mas malawak na problema sa produkto o operasyon.

Dapat mayroon ang bawat pares ng:

  • nakatalagang may-ari;

  • malinaw na desisyong sinusuportahan nito;

  • napagkasunduang mga threshold o pamantayan sa pagsusuri;

  • proseso ng pagsisiyasat; at

  • hanay ng mga posibleng interbensyon.

Kung wala ang mga elementong iyon, inoobserbahan lamang ng organisasyon ang produkto sa halip na pamahalaan ito.

Limang tanong para sa susunod ninyong pagsusuri ng mga sukatan

Bago magdagdag ng isa pang sukatan, pumili ng isang mahalagang desisyon sa produkto at sagutin ang mga tanong na ito. Isulat ang mga sagot upang matapos ang pagsusuri nang may napagkasunduang susunod na hakbang.

1. Anong desisyon ang kailangan naming matulungan ng mga sukatang ito?

Maging tiyak: nagpapasya ba tayo kung palalawakin ang automation, babaguhin ang modelo, o pahuhusayin ang paglilipat sa tao? Tukuyin muna ang desisyon bago piliin ang mga sukatan.

2. Kung bubuti ang numerong ito, ano ang maaaring lumala?

Tukuyin ang resultang kailangang protektahan at isang sukatang maglalantad ng pinsala. Halimbawa, ipares ang gastos sa bawat interaksiyon sa nasuring kalidad ng output upang matiyak kung kapaki-pakinabang pa rin ang mas murang mga sagot.

3. Ano ang maaaring itinatago ng mga pangunahing numero?

Suriin ang dalawang sukatan para sa parehong mga user, gawain, at panahon, saka hanapin ang mga grupong nakararanas ng mas malalang resulta. Isaalang-alang din ang panimulang kalagayan: maaaring dulot ng pagkadismayang nauna pa sa pakikipag-ugnayan sa support ang mababang kasiyahan.

4. Ano ang magtutulak sa aming kumilos, at sino ang may pananagutan sa pagtugon?

Magtakda ng pamantayan sa pagkilos kapag lumampas sa hindi katanggap-tanggap na limitasyon ang isang sukatan, bumuti ang isa habang lumalala ang kabila, o parehong lumala. Pagkasunduan kung sino ang magsisiyasat, ano ang una nilang susuriin, at kailan sila mag-uulat muli.

5. Angkop pa ba ang pares na ito sa kasalukuyang yugto ng produkto?

Magpasya kung pananatilihin, papalitan, o ihihinto ito. Maaaring tumuon ang pilot sa pagiging maaasahan ng gawain at tiwala ng user; maaaring kailanganin ng aktibong serbisyo ang mas masusing pagsusuri sa gastos at kalidad. Magtakda ng petsa upang muling suriin ang pinili.

Dapat higit pa sa paglalarawan ng performance ang pagsukat sa produktong AI. Dapat nitong ilantad ang mga trade-off na ginagawa ng organisasyon at gawing mas malinaw ang susunod na desisyon.

Mga may-akda

Ale Zacarias, Josie Steer