Overvåg konsekvenserne af afvejninger ved udvikling af AI-produkter

Synliggørelse af skjulte afvejninger hjælper teams med at diagnosticere fejl i AI-produkter og træffe bedre beslutninger.

Vigtigste konklusioner

  • Flere målinger giver ikke nødvendigvis større forståelse. Mange dashboards indeholder flere mål for den samme underliggende adfærd. Målinger bliver mere diagnostiske, når de kombineres i par med indbyrdes modstridende hensyn: omkostninger og kvalitet, selvbetjeningsgrad og kundernes holdning eller nøjagtighed og svartid.

  • De rette par ændrer sig, efterhånden som et AI-produkt går fra pilotfase til produktion. Målingerne bør følge de beslutninger, teamet skal træffe i hver fase.

  • Driftsovervågning og strategisk måling tjener forskellige formål. Teams kan følge hundredvis af systemsignaler, men kun bruge få par til at styre produktbeslutninger.

Overordnede nøgletal kan fortælle en overbevisende historie, samtidig med at en vigtig produktbeslutning står uløst.

Klarnas AI-assistent blev offentligt forbundet med større gennemløb, lavere omkostninger og kundetilfredshed på niveau med menneskelige agenter. Året efter besluttede virksomheden at øge adgangen til menneskelig support, og den administrerende direktør erkendte, at der havde været for stort fokus på at reducere omkostningerne.

Det var ikke en afvisning af AI-assistenten eller den underliggende teknologi. Det var en justering af balancen mellem automatisering og menneskelig service i takt med at virksomheden lærte af sine erfaringer med at betjene produktet. Efterhånden som automatiseringen overtog flere af de enklere forepørgsler med høj volumen, var de menneskelige agenter, som Klarna havde brug for, dem, der var rustet til komplekse, følsomme sager.

Flere målinger skaber ikke altid større klarhed

Når man fra begyndelsen har defineret, hvad et produkt skal opnå, vil de fleste organisationer, der udvikler AI-produkter, før eller siden stå med samme spørgsmål: Virker det faktisk?

Hvis svaret er uklart, er den umiddelbare reaktion ofte at tilføje flere målinger. Tre bliver til 10 og derefter til 30. Dashboardet bliver mere omfattende, men teamets forståelse bliver ikke nødvendigvis bedre.

Problemet er ikke altid kvaliteten af de enkelte mål, men forholdet mellem dem. Kundetilfredshed, Net Promoter Score, anmeldelser og andelen af positive tilkendegivelser kan alle give nyttige signaler, men de kan afspejle de samme ændringer i den generelle holdning. Når de bevæger sig i samme retning, bekræfter de, at der er sket noget, uden nødvendigvis at forklare hvorfor.

AI-teams bør derfor se ud over målinger, der bekræfter hinanden, og finde mål, som synliggør konkurrerende resultater. Disse par med indbyrdes modstridende hensyn synliggør og hjælper med at overvåge konsekvenserne af afvejningerne bag produktets resultater, så der kan træffes bedre beslutninger.

Overvågning af afvejninger ved udvikling af taleagenter i realtid: Da flere målinger holdt op med at hjælpe

I en implementering før lanceringen udviklede det fælles team en AI-taleagent i realtid til indgående kundesupportopkald. Et af de sværeste spørgsmål handlede ikke om valg eller orkestrering af modeller. Det handlede om, hvordan organisationen kunne vide, om produktet virkede, når kunderne begyndte at bruge det i stor skala.

Den første ramme anvendte tre mål:

  • Selvbetjeningsgrad: Hvor ofte AI'en løser et opkald uden at viderestille det til en person.

  • Eskaleringsgrad: Hvor ofte et opkald viderestilles til en menneskelig agent.

  • Løsningsgrad: Hvor ofte kundens problem i sidste ende bliver løst.

Hvert mål var fornuftigt. Samlet kunne de dog ikke besvare et oplagt spørgsmål: Hvad fortæller det os, hvis eskaleringen stiger?

Teamet opdelte eskalering i otte undertyper. Derefter tilføjede det mål for afbrydelse, forløb og timing, vurderinger af sprogforståelsen samt løsningsgrad efter forespørgselstype. Rammen kom til sidst til at omfatte 31 målinger fordelt på seks kategorier.

Den kunne beskrive eskalering i detaljer, men stadig ikke pålideligt diagnosticere årsagen. De fleste målinger var variationer af den samme adfærd, så de bevægede sig sammen i stedet for at afprøve konkurrerende forklaringer.

Dashboardet var blevet observerende frem for diagnostisk.

Brug par med indbyrdes modstridende hensyn til at synliggøre afvejninger

Teamet havde ikke brug for endnu et detaljeringsniveau. Det havde brug for målinger, der begrænsede hinanden.

Vi kalder dem par med indbyrdes modstridende hensyn: to mål, hvor en isoleret forbedring af det ene kan skade det resultat, som det andet repræsenterer. Navnet beskriver den fejltilstand, som ensidig optimering skaber, ikke den ønskede tilstand.

Når begge sider forbliver sunde, fungerer produktet muligvis bæredygtigt. Når de udvikler sig forskelligt, hjælper retningen på afvigelsen teamet med at afgøre, hvor det skal undersøge nærmere.

Det havde vi

Par med indbyrdes modstridende hensyn

Det kan parret afdække

Eskaleringsgrad opdelt i otte undertyper

Eskaleringsgrad ↔ tid til eskalering

Øjeblikkelig eskalering kan tyde på et problem med tillid eller rammesætning. Sen eskalering kan tyde på, at systemet ikke kan fuldføre opgaven.

Selvbetjeningsgrad og løsningsgrad rapporteret separat

Selvbetjeningsgrad ↔ kundernes holdning

Om selvbetjeningen afspejler en tilfredsstillende løsning, eller at kunden opgiver forsøget.

Løsningsgrad efter hensigtstype

Løsningsgrad ↔ samtalens dybde

Om en vellykket løsning er effektiv eller kræver en udmattende interaktion.

Lad os se nærmere på, hvordan dette bliver synligt, og hvordan indsigten kan bruges, ved at betragte eskaleringsgrad og tid til eskalering. Teamet ved ikke, hvordan kunderne reagerer, før de virkelige opkald kommer, men det kan definere de hypoteser, der skal afprøves.

Hvis flere opkald eskaleres, og kunderne forlader AI-oplevelsen inden for de første 30 sekunder, bør teamet undersøge tillid, oplysning om AI-brugen, tone og den indledende interaktion. Hvis kunderne eskalerer efter at have brugt flere minutter på at forsøge at løse en opgave, er manglende funktionalitet eller dækning af arbejdsgangen en mere sandsynlig årsag.

Det overordnede eskaleringstal er det samme. Produktbeslutningen er en anden.

Et nyttigt par beviser ikke årsagen alene. Det afgrænser undersøgelsen og gør den næste beslutning tydeligere.

Omkostninger og kvalitet skal vurderes samlet

Det tidligere Klarna-eksempel viser, hvordan princippet gælder, når omkostninger og servicekvalitet påvirker hinanden. Det viser, hvordan en AI-understøttet driftsmodel kan udvikle sig, når en virksomhed overvåger konsekvenserne af afvejninger og lærer af implementeringen.

I februar 2024 oplyste virksomheden, at dens AI-assistent havde håndteret 2,3 millioner samtaler i den første måned, udført arbejde svarende til 700 fuldtidsansatte agenter og opnået kundetilfredshed på niveau med menneskelige agenter. Klarna vurderede, at assistenten ville bidrage med en resultatforbedring på 40 millioner dollars i 2024. Det var Klarnas egne rapporterede resultater og ikke en uafhængig evaluering.

I maj 2025 sagde Klarnas administrerende direktør, at virksomheden havde fokuseret for meget på at reducere omkostningerne til kundeservice, og beskrev planer om at øge adgangen til menneskelig support. Det var en justering af balancen mellem automatiseret og menneskelig service, ikke en afvisning af AI-assistenten eller den bagvedliggende teknologi.

De offentligt tilgængelige oplysninger viser, hvorfor effektivitetsmål bør vurderes sammen med forskellige kunders og interaktioners behov. Et AI-system kan samlet set klare sig godt, selv om visse komplekse, følsomme eller usædvanlige sager stadig har gavn af en lettilgængelig menneskelig kanal.

Ved at overvåge begge sider af dette forhold kan en virksomhed afgøre, hvor automatisering skaber værdi, hvor menneskelig support fortsat er vigtig, og hvordan balancen bør ændres, når der kommer ny viden.

Andre par med indbyrdes modstridende hensyn på tværs af AI-produkter kan være:

Par med indbyrdes modstridende hensyn

Risikoen, som parret synliggør

Svarnøjagtighed ↔ svartid

Et system, der teknisk set er nøjagtigt, men for langsomt til arbejdsgangen.

Opgavefuldførelse ↔ brugerens tilsidesættelsesgrad

En AI-arbejdsgang, der fuldfører opgaver, som brugerne gentagne gange laver om.

Omkostning pr. interaktion ↔ vurderet outputkvalitet

Besparelser opnået ved at forringe kunde- eller medarbejderoplevelsen.

Ibrugtagning ↔ tid til værdi

Flere tilmeldinger uden en tilsvarende stigning i brugerværdien.

Formålet er ikke, at begge mål skal stige i det uendelige. Formålet er at gøre afvejningen synlig, før ensidig optimering skaber et driftsproblem.

Kundens udgangspunkt ændrer betydningen af et nøgletal

En beslægtet udfordring opstod ved implementering af spillersupport for en mobilspilsvirksomhed. Systemet håndterede mange henvendelser om blandt andet mistede fremskridt, betalingstvister og kontoadgang.

Effektivitetsmål var vigtige, fordi systemet blev anvendt i stor skala. Men spillersupport er ikke blot en operationel kø. Spillere er ofte frustrerede, når de henvender sig, fordi noget allerede er gået galt tidligere i deres oplevelse.

Det udgangspunkt ændrer, hvordan data om kundetilfredshed bør fortolkes. En spiller, hvis problem bliver løst korrekt, kan stadig angive lav tilfredshed, fordi vedkommende mistede sine fremskridt til at begynde med. Hvis denne score læses uden kontekst, kan supportinteraktionen blive straffet for frustration, der opstod tidligere i kunderejsen.

Teamet skulle derfor skelne mellem kundens oprindelige holdning og supportoplevelsens effekt. Det mere relevante spørgsmål var ikke: “Var spilleren tilfreds?” Det var: “Forbedrede interaktionen situationen i forhold til spillerens udgangspunkt?”

Denne sammenligning kan hjælpe med at skelne frustration over produktet fra supportens kvalitet, forudsat at teamet kan måle begge dele pålideligt.

Målingerne bør ændre sig med produktet

AI-produkter ændrer sig, men deres målinger forbliver ofte uændrede.

I en pilotfase kan det centrale spørgsmål være, om systemet er pålideligt nok til at retfærdiggøre fortsatte investeringer:

  • Fuldfører det kerneopgaven pålideligt?

  • Har brugerne tilstrækkelig tillid til at fortsætte?

  • Hvordan fungerer det uden for de mest almindelige scenarier?

  • Kan fejl identificeres og håndteres sikkert?

Disse spørgsmål taler for par som:

  • succes med kerneopgaven ↔ resultater i særtilfælde;

  • automatiseringsgrad ↔ grad af menneskelig tilsidesættelse; og

  • fuldførelseshastighed ↔ brugertillid.

Når produktet får driftsmæssig betydning, ændrer spørgsmålene sig:

  • Kan det skaleres uden at forringe kvaliteten?

  • Bliver økonomien bedre med øget brug?

  • Forbliver resultaterne stabile, når ibrugtagningen vokser?

  • Sker de menneskelige indgreb de rette steder?

De tilsvarende par kan ændre sig til:

  • omkostning pr. interaktion ↔ vurderet outputkvalitet;

  • udbredelse ↔ anvendelsesdybde; og

  • automatiseringsgrad ↔ eksponering for driftsrisici.

Tidlige målinger er ikke nødvendigvis forkerte. De besvarer de spørgsmål, der var vigtige på et tidligere tidspunkt.

Risikoen opstår i overgangen. Målinger fra pilotfasen består ofte, fordi teamet ved, hvordan de skal rapporteres, og ingen har ansvaret for at udfase dem. Mål, der tidligere understøttede læring, kan gradvist blive til forfængelighedsmål.

Par bør derfor have en livscyklus. Teams bør indføre dem til en bestemt beslutning, vurdere, om de stadig synliggør en væsentlig afvejning, og udfase dem, når produktet eller beslutningen ændrer sig.

Overvågning og beslutningstagning er forskellige lag

AI-systemer kræver detaljeret observerbarhed, alarmering, kvalitetssikring og evaluering. Hvis disse signaler blev fjernet, ville det blive sværere at drive produktet sikkert. Men driftsovervågning er ikke det samme som ledelsesmåling.

Overvågning hjælper teams med at opdage hændelser, spore fejl og forstå systemets adfærd. Beslutningsmålinger hjælper produkt- og forretningsledere med at afgøre, om de skal investere, gribe ind, ændre retning eller acceptere en afvejning.

En organisation kan overvåge hundredvis af tekniske og driftsmæssige signaler, men kun fremhæve to eller tre par med indbyrdes modstridende hensyn til en bestemt produktbeslutning. Et lille beslutningslag gør det lettere at prioritere.

Den rette evalueringsfrekvens afhænger af produktet. Et nyt system eller et system i hastig udvikling kan kræve ugentlige beslutningsmøder, mens et modent produkt kan evalueres månedligt eller kvartalsvist. Princippet er vigtigere end intervallet: Gennemgå parret ofte nok til at kunne handle, før afvejningen bliver dyr eller fører til sikkerhedsproblemer.

Definér, hvilken handling parret skal udløse

Et par bliver først nyttigt, når organisationen er enig om, hvad der skal ske, hvis det forværres.

Det kræver mere end at definere en kritisk grænse for afvigelsen. Teams bør overveje tre betingelser:

  • Absolut svigt: Ét mål overskrider en uacceptabel grænse, uanset det andet.

  • Afvigelse: Ét mål forbedres, mens modvægten forværres.

  • Fælles forværring: Begge sider forværres, hvilket tyder på et bredere produkt- eller driftsproblem.

Hvert par bør have:

  • en navngiven ansvarlig;

  • en klar beslutning, som det understøtter;

  • aftalte grænser eller evalueringskriterier;

  • en undersøgelsesplan; og

  • et sæt mulige indgreb.

Uden disse elementer observerer organisationen produktet frem for at styre det.

Fem spørgsmål til jeres næste gennemgang af målinger

Før I tilføjer endnu et mål, skal I vælge én vigtig produktbeslutning og arbejde jer gennem disse spørgsmål. Skriv svarene ned, så gennemgangen munder ud i et aftalt næste skridt.

1. Hvilken beslutning skal disse målinger hjælpe os med at træffe?

Vær konkret: Skal vi beslutte, om automatiseringen skal udvides, en model skal ændres, eller overdragelsen til mennesker skal forbedres? Definér beslutningen, før I vælger målene.

2. Hvad kan blive værre, hvis dette tal forbedres?

Find det resultat, I skal beskytte, og et mål, der vil synliggøre skade. Kombinér for eksempel omkostning pr. interaktion med vurderet outputkvalitet for at kontrollere, om billigere svar stadig er nyttige.

3. Hvad kan de overordnede tal skjule?

Læs begge mål for de samme brugere, opgaver og tidsperioder, og find derefter grupper, der oplever dårligere resultater. Tag også udgangspunktet i betragtning: Lav tilfredshed kan afspejle frustration, der opstod før supportinteraktionen.

4. Hvad skal få os til at handle, og hvem har ansvaret for reaktionen?

Fastlæg kriterier for at handle, når et mål overskrider en uacceptabel grænse, når det ene forbedres, mens det andet forværres, eller når begge forværres. Aftal, hvem der undersøger sagen, hvad der kontrolleres først, og hvornår der følges op.

5. Passer dette par stadig til produktets nuværende fase?

Beslut, om det skal beholdes, erstattes eller udfases. En pilot kan fokusere på opgavernes pålidelighed og brugernes tillid. En løsning i drift kan kræve tættere kontrol af omkostninger og kvalitet. Fastlæg en dato for at genoverveje valget.

Måling af AI-produkter bør gøre mere end at beskrive resultaterne. Den bør synliggøre organisationens afvejninger og gøre den næste beslutning tydeligere.

Forfattere

Ale Zacarias og Josie Steer