Праћење утицаја компромиса при развоју производа са вештачком интелигенцијом

Откривање скривених компромиса помаже тимовима да утврде узроке неуспеха производа заснованих на вештачкој интелигенцији и доносе боље одлуке.

Кључни закључци за руководиоце

  • Додавање метрика не побољшава нужно разумевање. Многе контролне табле садрже више мерила истог основног понашања. Метрике пружају бољи увид у узроке када се комбинују у међусобно супротстављене парове: трошак и квалитет, задржавање и расположење корисника или тачност и кашњење.

  • Одговарајући парови се мењају како производ заснован на вештачкој интелигенцији прелази из пилот-фазе у продукцију. Мерење треба да прати одлуке које тим мора да доноси у свакој фази.

  • Оперативни надзор и стратешко мерење имају различите сврхе. Тимови могу да прате стотине системских сигнала, а да се при доношењу одлука о производу ослањају на само неколико парова.

Главне метрике могу да испричају уверљиву причу, а да важно питање о производу ипак остане нерешено.

Компанијин асистент са вештачком интелигенцијом јавно је повезиван са већом пропусном моћи, нижим трошковима и оценама задовољства корисника упоредивим са оценама људских агената. Наредне године компанија је одлучила да повећа доступност људске подршке, а њен генерални директор је признао да је смањењу трошкова придаван превелики значај.

То није значило одбацивање асистента са вештачком интелигенцијом нити технологије на којој се заснива. Компанија је, на основу искуства стеченог коришћењем производа, прилагодила однос између аутоматизације и услуге коју пружају људи. Како је аутоматизација преузимала све више једноставнијих упита великог обима, компанији Klarna били су потребни људски агенти оспособљени за сложене, осетљиве случајеве.

Више метрика не доноси увек већу јасноћу

Након што на почетку дефинише шта производ треба да постигне, већина организација које развијају производе засноване на вештачкој интелигенцији на крају се суочи са истим питањем: да ли производ заиста ради?

Ако одговор није јасан, прва реакција је често додавање нових метрика. Од три настане 10, а затим од 10 настане 30. Контролна табла садржи све више података, али тим не мора зато боље да разуме ситуацију.

Проблем није увек у квалитету појединачних мерила, већ у њиховом међусобном односу. Задовољство корисника, нето скор промотера, рецензије и стопе позитивних оцена могу пружити корисне сигнале, али могу одражавати сличне промене општег расположења. Када се мењају заједно, потврђују да се нешто догодило, али не морају да објасне зашто.

Зато тимови за вештачку интелигенцију треба да посматрају више од метрика које се међусобно потврђују и да утврде која мерила откривају супротстављене исходе. Ови међусобно супротстављени парови откривају и помажу у праћењу последица компромиса који стоје иза учинка производа, што омогућава боље одлучивање.

Праћење компромиса при развоју гласовних агената у реалном времену: када додатне метрике више нису помагале

Током једне примене пре покретања, заједнички тим је развијао гласовног агента са вештачком интелигенцијом који би у реалном времену обрађивао долазне позиве корисничкој подршци. Једно од најтежих питања није се односило на избор модела нити на оркестрацију. Питање је било како ће организација знати да ли производ ради када корисници почну масовно да га користе.

Почетни оквир обухватао је три мерила:

  • Стопа задржавања: колико често вештачка интелигенција реши позив без пребацивања на особу.

  • Стопа ескалације: колико често се позив пребацује људском агенту.

  • Стопа решавања: колико често се проблем корисника на крају реши.

Свако мерило било је оправдано. Међутим, заједно нису могла да одговоре на очигледно питање: ако ескалација расте, шта нам то говори?

Тим је разврстао ескалације у осам подврста. Затим је додао мерила одустајања, корисничког пута и времена, оцене разумевања језика и стопу решавања према врсти упита. Оквир је на крају садржао 31 метрику у шест категорија.

Могао је детаљно да опише ескалацију, али и даље није могао поуздано да утврди њен узрок. Већина метрика биле су варијације истог понашања, па су се кретале заједно уместо да проверавају супротстављена објашњења.

Контролна табла је постала описна, а не дијагностичка.

Користите међусобно супротстављене парове да откријете компромисе

Тиму није био потребан још један ниво рашчлањивања. Биле су му потребне метрике које се међусобно ограничавају.

Називамо их међусобно супротстављеним паровима: то су два мерила код којих побољшавање једног изоловано може да нашкоди исходу који представља друго. Назив описује начин на који једнострана оптимизација може да доведе до неуспеха, а не пожељно стање.

Када обе стране остају на добром нивоу, производ можда функционише одрживо. Када се разиђу, смер разилажења помаже тиму да одлучи шта треба да испита.

Шта смо имали

Међусобно супротстављен пар

Шта пар може да открије

Стопа ескалације подељена на осам подврста

Стопа ескалације ↔ време до ескалације

Тренутна ескалација може указивати на проблем с поверењем или начином представљања; каснија ескалација може указивати на то да систем не може да заврши задатак.

Стопа задржавања и стопа решавања приказане засебно

Стопа задржавања ↔ расположење корисника

Да ли задржавање представља задовољавајуће решење или одустајање корисника од покушаја.

Стопа решавања према врсти намере

Стопа решавања ↔ дубина разговора

Да ли се проблем успешно и ефикасно решава или је за то потребна исцрпљујућа интеракција.

Да бисмо дубље сагледали како се то открива и шта треба учинити на основу тог увида, размотримо стопу ескалације и време до ескалације. Тим неће знати како се корисници понашају док не стигну стварни позиви, али може да дефинише хипотезе које треба проверити.

Ако све више позива почне да се ескалира, а корисници напуштају интеракцију са вештачком интелигенцијом у првих 30 секунди, тим треба да испита поверење, обавештења, тон и почетне интеракције. Ако корисници ескалирају позив након што су неколико минута покушавали да обаве задатак, вероватнији проблем су могућности система или покривеност радног тока.

Главна бројка ескалације је иста. Одлука о производу је другачија.

Користан пар сам по себи не доказује узрок. Он сужава истрагу и чини следећу одлуку јаснијом.

Трошак и квалитет морају се посматрати заједно

Раније наведени пример компаније Klarna показује како се ово начело примењује када су трошак и квалитет услуге међусобно повезани. Он показује како се оперативни модел заснован на вештачкој интелигенцији може развијати док компанија прати последице компромиса и учи на основу примене.

У фебруару 2024. компанија је саопштила да је њен асистент са вештачком интелигенцијом у првом месецу обрадио 2,3 милиона разговора, обавио посао еквивалентан раду 700 агената са пуним радним временом и постигао оцене задовољства корисника упоредиве са оценама људских агената. Klarna је проценила да ће асистент током 2024. допринети повећању добити од 40 милиона долара. То су били резултати које је објавила сама компанија Klarna, а не независна процена.

У мају 2025. генерални директор компаније Klarna рекао је да је компанија превише наглашавала смањење трошкова корисничке подршке и представио планове за већу доступност људске подршке. То је представљало прилагођавање односа између аутоматизоване услуге и услуге коју пружају људи, а не одбацивање асистента са вештачком интелигенцијом или технологије на којој се заснива.

Јавно доступни подаци показују зашто мерила ефикасности треба разматрати заједно са потребама различитих корисника и врста интеракција. Систем вештачке интелигенције може у просеку да ради добро, док за неке сложене, осетљиве или неуобичајене случајеве и даље може бити користан доступан канал за контакт са особом.

Праћење обе стране тог односа помаже компанији да одлучи где аутоматизација ствара вредност, где је људска подршка и даље важна и како однос треба мењати у складу с новим подацима.

Други међусобно супротстављени парови код производа заснованих на вештачкој интелигенцији могу да обухвате:

Међусобно супротстављен пар

Ризик који помаже да се открије

Тачност одговора ↔ кашњење одговора

Систем који је технички тачан, али преспор за дати радни ток.

Извршавање задатака ↔ стопа корисничких измена

Радни ток са вештачком интелигенцијом који завршава задатке које корисници затим изнова обављају.

Трошак по интеракцији ↔ процењени квалитет резултата

Уштеде остварене погоршавањем искуства корисника или запослених.

Усвајање ↔ време до остваривања вредности

Раст броја регистрација без одговарајуће вредности за кориснике.

Циљ није да оба мерила неограничено расту. Циљ је да компромис постане видљив пре него што једнострана оптимизација изазове оперативни проблем.

Почетно стање корисника мења значење метрике

Сродан изазов појавио се при примени система за подршку играчима у компанији за мобилне игре. Систем је обрађивао велики број проблема, попут изгубљеног напретка, спорова око плаћања и приступа налогу.

Мерила ефикасности била су важна јер је систем радио у великом обиму. Међутим, подршка играчима није само ред оперативних захтева. Играчи често долазе незадовољни јер је нешто већ пошло наопако у другом делу њиховог искуства.

То почетно стање мења начин на који треба тумачити податке о задовољству корисника. Играч чији је проблем правилно решен и даље може да пријави ниско задовољство зато што је уопште изгубио напредак. Тумачење те оцене без контекста може неправедно приписати интеракцији са подршком незадовољство настало раније током корисничког пута.

Зато је тим морао да разликује почетно расположење корисника од ефекта интеракције са подршком. Корисније питање није било: „Да ли је играч задовољан?” Већ: „Да ли је интеракција побољшала ситуацију у односу на почетно стање играча?”

То поређење може помоћи да се незадовољство производом одвоји од квалитета подршке, под условом да тим може поуздано да измери и једно и друго.

Мерење треба да се мења заједно са производом

Производи засновани на вештачкој интелигенцији се мењају, али њихове метрике често остају непромењене.

Током пилот-фазе, главно питање може бити да ли је систем довољно поуздан да оправда даље улагање:

  • Да ли поуздано завршава основни задатак?

  • Да ли му корисници довољно верују да би наставили да га користе?

  • Како се понаша ван најчешћих сценарија?

  • Да ли се неуспеси могу препознати и безбедно отклонити?

Тим питањима одговарају парови као што су:

  • успешност основног задатка ↔ учинак у граничним случајевима;

  • стопа аутоматизације ↔ стопа људских интервенција; и

  • брзина завршетка ↔ поверење корисника.

Када производ постане оперативно важан, питања се мењају:

  • Може ли да се прошири без смањења квалитета?

  • Да ли његова економичност расте са употребом?

  • Да ли учинак остаје стабилан како усвајање расте?

  • Да ли се људске интервенције дешавају на правим местима?

Одговарајући парови могу да се промене у:

  • трошак по интеракцији ↔ процењени квалитет резултата;

  • распрострањеност усвајања ↔ дубина употребе; и

  • стопа аутоматизације ↔ изложеност оперативном ризику.

Почетне метрике нису нужно погрешне. Оне одговарају на питања која су била важна у ранијој фази.

Ризик настаје током преласка. Метрике из пилот-фазе често остају у употреби јер тимови знају како да извештавају о њима, а нико није задужен за одлуку да се оне повуку. Мерила која су некада подржавала учење могу постепено да постану метрике које служе само за стварање доброг утиска.

Зато парови треба да имају свој животни циклус. Тимови треба да их уведу ради конкретне одлуке, проверавају да ли и даље откривају значајан компромис и повуку их када се производ или одлука промене.

Надзор и доношење одлука су различити нивои

Системи вештачке интелигенције захтевају детаљну опсервабилност, упозорења, осигурање квалитета и евалуацију. Уклањање тих сигнала отежало би безбедно управљање производом. Међутим, оперативни надзор није исто што и мерење намењено руководству.

Надзор помаже тимовима да открију инциденте, прате узроке отказа и разумеју понашање система. Метрике за одлучивање помажу руководиоцима производа и пословања да одлуче да ли да инвестирају, интервенишу, промене смер или прихвате компромис.

Организација може да прати стотине техничких и оперативних сигнала, а да за одређену одлуку о производу истакне само два или три међусобно супротстављена пара. Мали број метрика на том нивоу олакшава одређивање приоритета.

Одговарајућа учесталост прегледа зависи од производа. Нови систем или систем који се брзо мења може захтевати недељне прегледе одлука, док за зрео производ може бити довољан месечни или тромесечни ритам. Начело је важније од интервала: прегледајте пар довољно често да бисте реаговали пре него што компромис постане скуп или небезбедан.

Дефинишите коју радњу пар треба да покрене

Пар постаје користан тек када се организација договори шта ће се догодити ако се његове вредности погоршају.

За то није довољно дефинисати критичну границу разилажења. Тимови треба да размотре три услова:

  • Апсолутни неуспех: једно мерило прелази неприхватљив праг, без обзира на друго.

  • Разилажење: једно мерило се побољшава, док се његова противтежа погоршава.

  • Заједничко погоршање: обе стране опадају, што указује на шири проблем са производом или радом.

Сваки пар треба да има:

  • именованог власника;

  • јасну одлуку коју подржава;

  • усаглашене прагове или критеријуме за евалуацију;

  • поступак истраге; и

  • скуп могућих интервенција.

Без тих елемената организација само посматра производ уместо да њиме управља.

Пет питања за следећи преглед метрика

Пре него што додате још једно мерило, изаберите једну важну одлуку о производу и одговорите на следећа питања. Запишите одговоре како би се преглед завршио договором о следећем кораку.

1. Коју одлуку ове метрике треба да нам помогну да донесемо?

Будите конкретни: да ли одлучујемо о проширењу аутоматизације, промени модела или побољшању предаје посла људима? Именујте одлуку пре него што изаберете мерила.

2. Ако се овај број побољша, шта би могло да се погорша?

Утврдите који исход морате да заштитите и које би мерило открило штету. На пример, упарите трошак по интеракцији са процењеним квалитетом резултата да бисте проверили да ли су јефтинији одговори и даље корисни.

3. Шта би главне бројке могле да прикривају?

Посматрајте оба мерила за исте кориснике, задатке и временски период, а затим потражите групе које имају лошије исходе. Узмите у обзир и почетне услове: ниско задовољство може одражавати незадовољство које је постојало и пре интеракције са подршком.

4. Шта би нас навело да реагујемо и ко је одговоран за реакцију?

Одредите критеријуме за реаговање када мерило пређе неприхватљиву границу, када се једно побољшава док се друго погоршава или када се оба погоршавају. Договорите се ко ће истражити проблем, шта ће прво проверити и када ће известити о налазима.

5. Да ли овај пар и даље одговара тренутној фази производа?

Одлучите да ли ћете га задржати, заменити или повући. Пилот-фаза се може усредсредити на поузданост извршавања задатака и поверење корисника, док активна услуга може захтевати пажљивије праћење трошкова и квалитета. Одредите датум за поновно разматрање избора.

Мерење производа заснованих на вештачкој интелигенцији треба да чини више од описивања учинка. Треба да открије компромисе које организација прави и учини следећу одлуку јаснијом.

Аутори

Ale Zacarias и Josie Steer