Mittareiden lisääminen ei välttämättä paranna ymmärrystä. Monissa koontinäytöissä on useita saman taustalla olevan käyttäytymisen mittareita. Mittarit auttavat diagnosoinnissa paremmin, kun ne yhdistetään toisiaan heikentäviksi pareiksi: kustannukset ja laatu, itsenäinen ratkaisuaste ja asiakastyytyväisyys tai tarkkuus ja viive.
Sopivat parit muuttuvat, kun tekoälytuote etenee pilotista tuotantoon. Mittaamisen tulee perustua päätöksiin, joita tiimin on tehtävä kussakin vaiheessa.
Operatiivisella seurannalla ja strategisella mittaamisella on eri tarkoitukset. Tiimit voivat seurata satoja järjestelmän signaaleja mutta käyttää tuotepäätösten tukena vain muutamaa mittariparia.
Päämittarit voivat kertoa vakuuttavan tarinan mutta jättää tärkeän tuotepäätöksen ratkaisematta.
Klarnan tekoälyavustaja yhdistettiin julkisuudessa parempaan suoritustehoon, pienempiin kustannuksiin ja ihmisagenttien tasoisiin asiakastyytyväisyyslukuihin. Seuraavana vuonna yhtiö päätti parantaa ihmisiltä saatavan tuen saatavuutta, ja sen toimitusjohtaja myönsi, että kustannusten vähentämistä oli painotettu liikaa.
Kyse ei ollut tekoälyavustajan tai sen perustana olevan teknologian hylkäämisestä. Yhtiö mukautti automaation ja ihmisten tarjoaman palvelun tasapainoa tuotteesta käytännössä saatujen kokemusten perusteella. Kun automaatio hoiti yhä enemmän runsaslukuisia, yksinkertaisempia kyselyjä, Klarnan tarvitsemat ihmisagentit olivat sellaisia, jotka pystyivät käsittelemään monimutkaisia ja arkaluonteisia tapauksia.
Kun tekoälytuotetta kehittävä organisaatio on aluksi määritellyt, mitä tuotteella halutaan saavuttaa, se kohtaa yleensä lopulta saman kysymyksen: toimiiko tuote todella?
Jos vastaus on epäselvä, ensimmäinen reaktio on usein lisätä mittareita. Kolmesta tulee 10 ja kymmenestä 30. Koontinäyttö monipuolistuu, mutta tiimin ymmärrys ei välttämättä parane.
Ongelmana ei aina ole yksittäisten mittareiden laatu vaan niiden keskinäinen suhde. Asiakastyytyväisyys, suositteluindeksi, arvostelut ja peukutusten määrä voivat kaikki antaa hyödyllisiä signaaleja, mutta ne saattavat kuvastaa samoja muutoksia yleisessä suhtautumisessa. Kun ne muuttuvat samaan suuntaan, ne vahvistavat, että jotakin on tapahtunut, mutta eivät välttämättä selitä syytä.
Tekoälytiimien tulisi siksi katsoa toisiaan tukevia mittareita pidemmälle ja tunnistaa mittarit, jotka tuovat kilpailevat lopputulokset näkyviin. Nämä toisiaan heikentävät parit paljastavat tuotteiden suorituskyvyn taustalla olevien kompromissien vaikutukset, auttavat seuraamaan niitä ja tukevat parempaa päätöksentekoa.
Eräässä ennen julkaisua toteutetussa hankkeessa yhteinen tiimi kehitti reaaliaikaista tekoälypuheagenttia saapuviin asiakastukipuheluihin. Yksi vaikeimmista kysymyksistä ei koskenut mallin valintaa tai orkestrointia. Haasteena oli selvittää, mistä organisaatio tietäisi tuotteen toimivan, kun asiakkaat alkaisivat käyttää sitä laajasti.
Alkuperäinen viitekehys sisälsi kolme mittaria:
Itsenäinen ratkaisuaste: kuinka usein tekoäly ratkaisee puhelun siirtämättä sitä ihmiselle.
Eskalointiaste: kuinka usein puhelu siirretään ihmisagentille.
Ratkaisuaste: kuinka usein asiakkaan ongelma lopulta ratkaistaan.
Jokainen mittari oli sinänsä perusteltu. Yhdessä ne eivät kuitenkaan vastanneet ilmeiseen kysymykseen: mitä eskaloinnin lisääntyminen kertoo?
Tiimi jakoi eskaloinnit kahdeksaan alatyyppiin. Sitten se lisäsi keskeyttämistä, asiakaspolkua ja ajoitusta koskevia mittareita, kielen ymmärtämisen pistemääriä sekä kyselytyyppikohtaisen ratkaisuasteen. Lopulta viitekehys sisälsi 31 mittaria kuudessa kategoriassa.
Se kuvasi eskalointia yksityiskohtaisesti, mutta ei edelleenkään pystynyt luotettavasti selvittämään sen syytä. Useimmat mittarit kuvasivat saman käyttäytymisen eri muotoja, joten ne muuttuivat yhdessä sen sijaan, että ne olisivat testanneet kilpailevia selityksiä.
Koontinäyttö oli muuttunut havainnoivaksi eikä enää tukenut diagnosointia.
Tiimi ei tarvinnut enää yhtä uutta erittelytasoa. Se tarvitsi toisiaan rajoittavia mittareita.
Kutsumme näitä toisiaan heikentäviksi pareiksi: kyse on kahdesta mittarista, joista toisen parantaminen erillään voi vahingoittaa toisen kuvaamaa lopputulosta. Nimi kuvaa yksipuolisen optimoinnin aiheuttamaa ongelmatilannetta, ei tavoiteltua tilaa.
Kun molemmat puolet pysyvät hyvällä tasolla, tuote saattaa toimia kestävällä tavalla. Kun ne erkanevat toisistaan, muutoksen suunta auttaa tiimiä päättämään, mitä kannattaa tutkia.
Mitä meillä oli | Toisiaan heikentävä pari | Mitä pari voi paljastaa |
|---|---|---|
Kahdeksaan alatyyppiin jaettu eskalointiaste | Eskalointiaste ↔ eskalointiin kuluva aika | Välitön eskalointi voi viitata luottamukseen tai asian esittämistapaan liittyvään ongelmaan. Myöhempi eskalointi voi kertoa, ettei järjestelmä pysty suorittamaan tehtävää loppuun. |
Itsenäinen ratkaisuaste ja ratkaisuaste raportoitu erikseen | Itsenäinen ratkaisuaste ↔ asiakkaan suhtautuminen | Kertooko itsenäinen ratkaisu tyydyttävästä lopputuloksesta vai siitä, että asiakas luopui yrityksestä? |
Ratkaisuaste asiointisyyn mukaan | Ratkaisuaste ↔ keskustelun syvyys | Ratkeaako asia tehokkaasti vai vaatiiko onnistunut ratkaisu uuvuttavan vuorovaikutuksen? |
Tarkastellaan seuraavaksi eskalointiastetta ja eskalointiin kuluvaa aikaa, jotta ymmärrämme tarkemmin, miten kompromissi tulee näkyviin ja miten tietoa voidaan hyödyntää. Tiimi ei tiedä, miten asiakkaat käyttäytyvät, ennen kuin todellisia puheluita saapuu, mutta se voi määrittää testattavat hypoteesit.
Jos yhä useampi puhelu eskaloidaan ja asiakkaat poistuvat tekoälykokemuksesta ensimmäisten 30 sekunnin aikana, tiimin tulisi tutkia luottamusta, tekoälystä kertomista, äänensävyä ja vuorovaikutuksen alkua. Jos asiakkaat eskaloivat puhelun yritettyään suorittaa tehtävää useita minuutteja, todennäköisempi ongelma liittyy kyvykkyyksiin tai työnkulkujen kattavuuteen.
Eskaloinnin pääluku on sama. Tuotepäätös on kuitenkin erilainen.
Hyödyllinen pari ei yksin todista syytä. Se rajaa tutkintaa ja selkeyttää seuraavaa päätöstä.
Aiemmin esitelty Klarna-esimerkki osoittaa, miten tätä periaatetta sovelletaan kustannusten ja palvelun laadun vuorovaikutukseen. Se osoittaa, miten tekoälyä hyödyntävä toimintamalli voi kehittyä, kun yritys seuraa kompromissien vaikutuksia ja oppii käyttöönotosta.
Helmikuussa 2024 yhtiö kertoi tekoälyavustajansa hoitaneen ensimmäisen kuukauden aikana 2,3 miljoonaa keskustelua, tehneen 700 kokoaikaisen agentin työmäärää vastaavan työn ja saavuttaneen ihmisagenttien tasoiset asiakastyytyväisyysluvut. Klarna arvioi avustajan parantavan tulosta 40 miljoonalla dollarilla vuoden 2024 aikana. Kyse oli Klarnan itse ilmoittamista tuloksista, ei riippumattomasta arvioinnista.
Toukokuussa 2025 Klarnan toimitusjohtaja kertoi yhtiön painottaneen asiakaspalvelun kustannusten vähentämistä liikaa ja kuvasi suunnitelmia parantaa ihmisiltä saatavan tuen saatavuutta. Kyse oli automaattisen ja ihmisten tarjoaman palvelun tasapainon muuttamisesta, ei tekoälyavustajan tai sen perustana olevan teknologian hylkäämisestä.
Julkinen näyttö havainnollistaa, miksi tehokkuusmittareita on tarkasteltava erilaisten asiakkaiden ja vuorovaikutustilanteiden tarpeiden rinnalla. Tekoälyjärjestelmä voi toimia keskimäärin hyvin, vaikka joissakin monimutkaisissa, arkaluonteisissa tai epätavallisissa tapauksissa helposti saatavilla oleva ihmiskanava olisi edelleen hyödyksi.
Suhteen molempien puolien seuranta auttaa yritystä päättämään, missä automaatio tuottaa arvoa, missä ihmisen tarjoama tuki on edelleen tärkeää ja miten tasapainoa tulisi muuttaa uuden näytön perusteella.
Muita tekoälytuotteiden toisiaan heikentäviä pareja voivat olla:
Toisiaan heikentävä pari | Riski, jonka se auttaa paljastamaan |
|---|---|
Vastauksen tarkkuus ↔ vastausviive | Järjestelmä on teknisesti tarkka mutta liian hidas työnkulkuun. |
Tehtävän suorittaminen ↔ käyttäjän tekemien ohitusten osuus | Tekoälytyönkulku suorittaa tehtäviä, jotka käyttäjät tekevät toistuvasti uudelleen. |
Vuorovaikutuskohtainen kustannus ↔ arvioitu tuotoksen laatu | Säästöjä saadaan heikentämällä asiakkaan tai työntekijän kokemusta. |
Käyttöönotto ↔ arvon saavuttamiseen kuluva aika | Rekisteröitymisten määrä kasvaa ilman vastaavaa käyttäjille tuotettua arvoa. |
Tarkoitus ei ole kasvattaa kumpaakin mittaria loputtomasti. Tavoitteena on tehdä kompromissi näkyväksi ennen kuin yksipuolinen optimointi aiheuttaa operatiivisen ongelman.
Vastaava haaste ilmeni mobiilipeliyhtiön pelaajatuen käyttöönotossa. Järjestelmä käsitteli suuria määriä ongelmia, kuten edistymisen menettämistä, maksukiistoja ja tilien käyttöoikeuksia.
Tehokkuusmittarit olivat tärkeitä, koska järjestelmää käytettiin laajassa mittakaavassa. Pelaajatuki ei kuitenkaan ole pelkkä operatiivinen jono. Pelaajat saapuvat usein turhautuneina, koska jokin on jo mennyt pieleen muualla heidän kokemuksessaan.
Tämä lähtötilanne vaikuttaa siihen, miten asiakastyytyväisyystietoja tulisi tulkita. Pelaaja voi ilmoittaa heikosta tyytyväisyydestä, vaikka hänen ongelmansa ratkaistaisiin oikein, koska hän alun perin menetti edistymisensä. Pistemäärän tarkastelu ilman asiayhteyttä voi rankaista tukitilannetta turhautumisesta, joka syntyi jo aiemmin asiakaspolulla.
Tiimin oli siksi erotettava asiakkaan suhtautuminen lähtötilanteessa tukikokemuksen vaikutuksesta. Hyödyllisempi kysymys ei ollut: ”Oliko pelaaja tyytyväinen?” Vaan: ”Paransiko vuorovaikutus tilannetta pelaajan lähtötilanteeseen verrattuna?”
Vertailu voi auttaa erottamaan tuotteesta johtuvan turhautumisen tuen laadusta, jos tiimillä on luotettava tapa mitata molempia.
Tekoälytuotteet muuttuvat, mutta niiden mittarit pysyvät usein ennallaan.
Pilotin aikana keskeinen kysymys voi olla, onko järjestelmä riittävän luotettava jatkoinvestoinnin perustelemiseksi:
Suorittaako se ydintehtävän luotettavasti loppuun?
Luottavatko käyttäjät siihen riittävästi jatkaakseen käyttöä?
Miten se toimii yleisimpien tilanteiden ulkopuolella?
Voidaanko virheet tunnistaa ja korjata turvallisesti?
Näihin kysymyksiin sopivat esimerkiksi seuraavat parit:
ydintehtävän onnistuminen ↔ suorituskyky poikkeustapauksissa;
automaatioaste ↔ ihmisen tekemien ohitusten osuus; ja
suoritusnopeus ↔ käyttäjien luottamus.
Kun tuotteesta tulee toiminnan kannalta tärkeä, kysymykset muuttuvat:
Voiko sen käyttöä laajentaa laadun heikkenemättä?
Paraneeko sen kannattavuus käytön myötä?
Pysyykö suorituskyky vakaana käyttöönoton laajentuessa?
Tapahtuvatko ihmisten väliintulot oikeissa kohdissa?
Vastaavat parit voivat muuttua seuraaviksi:
vuorovaikutuskohtainen kustannus ↔ arvioitu tuotoksen laatu;
käyttöönoton laajuus ↔ käytön syvyys; ja
automaatioaste ↔ altistuminen operatiivisille riskeille.
Alkuvaiheen mittarit eivät välttämättä ole vääriä. Ne vastaavat kysymyksiin, jotka olivat tärkeitä aiemmassa vaiheessa.
Riski syntyy siirtymävaiheessa. Pilottivaiheen mittarit jäävät usein käyttöön, koska tiimit osaavat raportoida niistä eikä kukaan vastaa niiden käytöstä poistamisesta. Oppimista aiemmin tukeneet mittarit voivat vähitellen muuttua turhamaisuusmittareiksi.
Myös pareilla tulisi siksi olla elinkaari. Tiimien tulisi ottaa ne käyttöön tiettyä päätöstä varten, arvioida, tuovatko ne edelleen olennaisen kompromissin näkyviin, ja poistaa ne käytöstä tuotteen tai päätöksen muuttuessa.
Tekoälyjärjestelmät edellyttävät yksityiskohtaista havainnoitavuutta, hälytyksiä, laadunvarmistusta ja arviointia. Näiden signaalien poistaminen vaikeuttaisi tuotteen turvallista käyttöä. Operatiivinen seuranta ei kuitenkaan ole sama asia kuin johdon käyttämä mittaaminen.
Seuranta auttaa tiimejä havaitsemaan häiriöitä, jäljittämään virheitä ja ymmärtämään järjestelmän käyttäytymistä. Päätöksentekomittarit auttavat tuote- ja liiketoimintajohtoa päättämään, investoidaanko, puututaanko tilanteeseen, muutetaanko suuntaa vai hyväksytäänkö kompromissi.
Organisaatio voi seurata satoja teknisiä ja operatiivisia signaaleja mutta nostaa tiettyä tuotepäätöstä varten esiin vain kaksi tai kolme toisiaan heikentävää paria. Päätöksentekotason pitäminen suppeana helpottaa priorisointia.
Sopiva tarkistusväli riippuu tuotteesta. Uusi tai nopeasti muuttuva järjestelmä saattaa vaatia päätösten viikoittaista tarkastelua, kun taas kypsälle tuotteelle voi riittää kuukausittainen tai neljännesvuosittainen rytmi. Periaate on aikaväliä tärkeämpi: tarkastele paria riittävän usein, jotta kompromissiin voidaan reagoida ennen kuin se muuttuu kalliiksi tai vaaralliseksi.
Parista tulee hyödyllinen vasta, kun organisaatio sopii, mitä sen heikentyessä tehdään.
Tämä vaatii muutakin kuin erkanemisen kriittisen rajan määrittämistä. Tiimien tulisi huomioida kolme tilannetta:
Ehdoton epäonnistuminen: toinen mittari ylittää hyväksymättömän rajan toisen arvosta riippumatta.
Erkaneminen: toinen mittari paranee samalla, kun sitä tasapainottava mittari heikkenee.
Yhteinen heikkeneminen: molemmat puolet heikkenevät, mikä viittaa laajempaan tuote- tai toimintaongelmaan.
Jokaisella parilla tulisi olla:
nimetty vastuuhenkilö;
selkeä päätös, jota se tukee;
sovitut raja-arvot tai arviointikriteerit;
tutkintapolku; ja
joukko mahdollisia toimenpiteitä.
Ilman näitä organisaatio vain tarkkailee tuotetta eikä hallitse sitä.
Valitse ennen uuden mittarin lisäämistä yksi tärkeä tuotepäätös ja käy läpi seuraavat kysymykset. Kirjaa vastaukset muistiin, jotta katsauksen päätteeksi voidaan sopia seuraavasta vaiheesta.
1. Minkä päätöksen tekemisessä näiden mittareiden on autettava?
Ole täsmällinen: päätämmekö automaation laajentamisesta, mallin vaihtamisesta vai ihmiselle siirtämisen parantamisesta? Määritä päätös ennen mittareiden valitsemista.
2. Jos tämä luku paranee, mikä voisi heikentyä?
Tunnista suojeltava lopputulos ja mittari, joka toisi haitan näkyviin. Yhdistä esimerkiksi vuorovaikutuskohtainen kustannus arvioituun tuotoksen laatuun ja tarkista, ovatko halvemmat vastaukset edelleen hyödyllisiä.
3. Mitä pääluvut saattavat peittää?
Tarkastele molempia mittareita samoilta käyttäjiltä, samoista tehtävistä ja samalta ajanjaksolta. Etsi sitten ryhmiä, joiden tulokset ovat heikompia. Huomioi myös lähtötilanne: heikko tyytyväisyys voi johtua turhautumisesta, joka alkoi jo ennen tukitilannetta.
4. Mikä saa meidät toimimaan ja kuka vastaa toimista?
Määritä toimintakriteerit tilanteisiin, joissa mittari ylittää hyväksymättömän rajan, toinen paranee ja toinen heikkenee tai molemmat heikkenevät. Sopikaa, kuka tutkii tilanteen, mitä hän tarkistaa ensin ja milloin hän raportoi havainnoista.
5. Sopiiko tämä pari yhä tuotteen nykyiseen vaiheeseen?
Päätä, säilytetäänkö, korvataanko vai poistetaanko se käytöstä. Pilotti voi keskittyä tehtävien luotettavaan suorittamiseen ja käyttäjien luottamukseen. Tuotantopalvelussa kustannuksia ja laatua on ehkä tarkasteltava lähemmin. Aseta päivämäärä valinnan uudelleenarvioinnille.
Tekoälytuotteiden mittaamisen tulee tehdä muutakin kuin kuvata suorituskykyä. Sen tulee tuoda organisaation tekemät kompromissit näkyviin ja selkeyttää seuraavaa päätöstä.