Mehr Kennzahlen führen nicht zwangsläufig zu einem besseren Verständnis. Viele Dashboards enthalten mehrere Kennzahlen für dasselbe zugrunde liegende Verhalten. Kennzahlen liefern bessere Diagnosen, wenn sie zu gegenläufigen Paaren verbunden werden: Kosten und Qualität, Lösungsquote und Stimmung oder Genauigkeit und Latenz.
Welche Paare geeignet sind, ändert sich beim Übergang eines KI-Produkts vom Pilotprojekt in den Produktivbetrieb. Die Messung sollte sich an den Entscheidungen orientieren, die das Team in jeder Phase treffen muss.
Operative Überwachung und strategische Messung dienen unterschiedlichen Zwecken. Teams können Hunderte Systemsignale erfassen und zugleich nur wenige Kennzahlenpaare für Produktentscheidungen nutzen.
Hauptkennzahlen können eine überzeugende Geschichte erzählen und dennoch eine wichtige Produktentscheidung offenlassen.
Der KI-Assistent von Klarna wurde öffentlich mit höherem Durchsatz, geringeren Kosten und einer mit menschlichen Servicemitarbeitenden vergleichbaren Kundenzufriedenheit verbunden. Im folgenden Jahr beschloss das Unternehmen, den Zugang zu menschlichem Support auszubauen. Der Vorstandsvorsitzende räumte ein, dass die Kostensenkung zu stark gewichtet worden war.
Das war keine Ablehnung des KI-Assistenten oder seiner zugrunde liegenden Technologie. Es war eine Anpassung des Verhältnisses zwischen Automatisierung und menschlichem Service, während das Unternehmen aus dem Betrieb des Produkts lernte. Während die Automatisierung immer mehr der einfacheren Anfragen mit hohem Aufkommen übernahm, benötigte Klarna menschliche Mitarbeitende, die für komplexe, sensible Fälle gerüstet waren.
Nachdem sie von Anfang an festgelegt haben, was ein Produkt erreichen soll, stehen die meisten Unternehmen, die KI-Produkte entwickeln, irgendwann vor derselben Frage: Funktioniert es tatsächlich?
Ist die Antwort unklar, liegt es oft nahe, weitere Kennzahlen hinzuzufügen. Aus drei werden zehn, aus zehn dann 30. Das Dashboard wird umfangreicher, doch das Verständnis des Teams verbessert sich möglicherweise nicht.
Das Problem liegt nicht immer in der Qualität der einzelnen Messgrößen, sondern in ihrer Beziehung zueinander. Kundenzufriedenheit, Net Promoter Score, Bewertungen und positive Reaktionen können nützliche Signale liefern, spiegeln aber möglicherweise ähnliche Veränderungen der allgemeinen Stimmung wider. Wenn sie sich parallel entwickeln, bestätigen sie, dass etwas geschehen ist, erklären aber nicht unbedingt, warum.
KI-Teams sollten daher über übereinstimmende Kennzahlen hinausblicken und Messgrößen bestimmen, die konkurrierende Ergebnisse sichtbar machen. Solche gegenläufigen Paare zeigen die Auswirkungen von Zielkonflikten auf die Produktleistung, helfen bei ihrer Überwachung und ermöglichen bessere Entscheidungen.
Bei einer Implementierung vor der Markteinführung entwickelte das gemeinsame Team einen KI-Sprach-Agenten für eingehende Supportanrufe in Echtzeit. Eine der schwierigsten Fragen betraf weder die Modellauswahl noch die Orchestrierung. Es ging darum, wie das Unternehmen erkennen würde, ob das Produkt funktioniert, sobald es in großem Umfang genutzt wird.
Das ursprüngliche Konzept verwendete drei Messgrößen:
Lösungsquote ohne Weiterleitung: wie oft die KI einen Anruf klärt, ohne ihn an einen Menschen weiterzuleiten.
Eskalationsquote: wie oft ein Anruf an einen Menschen weitergeleitet wird.
Erfüllungsquote: wie oft das Anliegen letztlich gelöst wird.
Jede Messgröße war für sich sinnvoll. Zusammen konnten sie jedoch eine naheliegende Frage nicht beantworten: Was sagt uns eine steigende Eskalationsquote?
Das Team unterteilte Eskalationen in acht Untertypen. Anschließend ergänzte es Kennzahlen zu Abbrüchen, Abläufen und Zeiten, Bewertungen des Sprachverständnisses sowie die Erfüllungsquote nach Art der Anfrage. Das Konzept umfasste schließlich 31 Kennzahlen in sechs Kategorien.
Es konnte Eskalationen detailliert beschreiben, ihre Ursache aber weiterhin nicht zuverlässig bestimmen. Die meisten Kennzahlen waren Varianten desselben Verhaltens. Sie entwickelten sich daher parallel, statt konkurrierende Erklärungen zu prüfen.
Das Dashboard diente nun der Beobachtung statt der Diagnose.
Das Team brauchte keine weitere Unterteilung. Es brauchte Kennzahlen, die sich gegenseitig begrenzen.
Wir nennen sie gegenläufige Kennzahlenpaare: zwei Messgrößen, bei denen die isolierte Verbesserung der einen dem Ergebnis schaden kann, das die andere abbildet. Der Name bezeichnet das Fehlermuster einer einseitigen Optimierung, nicht den gewünschten Zustand.
Bleiben beide Seiten auf einem guten Niveau, wird das Produkt möglicherweise nachhaltig betrieben. Entwickeln sie sich auseinander, zeigt die Richtung der Abweichung dem Team, wo es nach der Ursache suchen sollte.
Was wir hatten | Gegenläufiges Kennzahlenpaar | Was das Paar zeigen kann |
|---|---|---|
In acht Untertypen unterteilte Eskalationsquote | Eskalationsquote ↔ Zeit bis zur Eskalation | Eine sofortige Eskalation kann auf ein Vertrauens- oder Darstellungsproblem hindeuten. Eine spätere Eskalation kann bedeuten, dass das System die Aufgabe nicht abschließen kann. |
Lösungsquote ohne Weiterleitung und Erfüllungsquote separat ausgewiesen | Lösungsquote ohne Weiterleitung ↔ Kundenstimmung | Ob die fehlende Weiterleitung eine zufriedenstellende Lösung bedeutet oder ob die Person den Versuch abbricht. |
Erfüllungsquote nach Anliegen | Erfüllungsquote ↔ Gesprächstiefe | Ob die erfolgreiche Lösung effizient erfolgt oder eine ermüdende Interaktion erfordert. |
Um genauer zu betrachten, wie dies sichtbar wird und wie sich die Erkenntnis nutzen lässt, sehen wir uns die Eskalationsquote und die Zeit bis zur Eskalation an. Das Team weiß erst nach den ersten echten Anrufen, wie sich die Kundschaft verhält. Es kann aber vorab die zu prüfenden Hypothesen festlegen.
Werden mehr Anrufe eskaliert und verlassen Personen das KI-Erlebnis innerhalb der ersten 30 Sekunden, sollte das Team Vertrauen, Transparenz, Tonfall und Gesprächseinstieg untersuchen. Eskalieren Personen erst, nachdem sie mehrere Minuten lang eine Aufgabe zu erledigen versucht haben, liegt das Problem eher bei den Fähigkeiten oder der Abdeckung von Arbeitsabläufen.
Die Eskalationsquote als Hauptkennzahl ist dieselbe. Die Produktentscheidung ist eine andere.
Ein nützliches Paar belegt die Ursache nicht von selbst. Es grenzt die Untersuchung ein und erleichtert die nächste Entscheidung.
Das bereits erwähnte Klarna-Beispiel zeigt, wie dieses Prinzip beim Zusammenspiel von Kosten und Servicequalität gilt. Es verdeutlicht, wie sich ein KI-gestütztes Betriebsmodell weiterentwickeln kann, wenn ein Unternehmen die Auswirkungen von Zielkonflikten überwacht und aus der Implementierung lernt.
Im Februar 2024 berichtete das Unternehmen, sein KI-Assistent habe im ersten Monat 2,3 Millionen Gespräche geführt, die Arbeit von 700 Vollzeitbeschäftigten geleistet und eine mit menschlichen Servicemitarbeitenden vergleichbare Kundenzufriedenheit erzielt. Klarna schätzte, dass der Assistent 2024 zu einer Gewinnsteigerung von 40 Millionen US-Dollar beitragen würde. Dabei handelte es sich um von Klarna selbst gemeldete Ergebnisse, nicht um eine unabhängige Evaluation.
Im Mai 2025 sagte der Vorstandsvorsitzende von Klarna, das Unternehmen habe die Kostensenkung im Kundenservice zu stark gewichtet, und erläuterte Pläne für einen besseren Zugang zu menschlichem Support. Dies war eine Anpassung des Verhältnisses zwischen automatisiertem und menschlichem Service, keine Abkehr vom KI-Assistenten oder der zugrunde liegenden Technologie.
Die öffentlich verfügbaren Belege zeigen, warum Effizienzkennzahlen zusammen mit den Bedürfnissen unterschiedlicher Menschen und Interaktionen betrachtet werden sollten. Ein KI-System kann im Durchschnitt gut abschneiden, während bei manchen komplexen, sensiblen oder ungewöhnlichen Fällen ein leicht zugänglicher menschlicher Kontakt weiterhin hilfreich ist.
Indem es beide Seiten dieser Beziehung überwacht, kann ein Unternehmen entscheiden, wo Automatisierung Mehrwert schafft, wo menschlicher Support wichtig bleibt und wie sich das Verhältnis angesichts neuer Erkenntnisse ändern sollte.
Weitere gegenläufige Kennzahlenpaare für KI-Produkte können sein:
Gegenläufiges Kennzahlenpaar | Risiko, das es sichtbar macht |
|---|---|
Antwortgenauigkeit ↔ Antwortlatenz | Ein System, das technisch genaue Ergebnisse liefert, für den Arbeitsablauf aber zu langsam ist. |
Aufgabenerledigung ↔ Quote manueller Korrekturen | Ein KI-Arbeitsablauf, der Aufgaben erledigt, die Nutzende wiederholt neu ausführen. |
Kosten je Interaktion ↔ bewertete Ergebnisqualität | Einsparungen zulasten des Erlebnisses von Kundschaft oder Beschäftigten. |
Akzeptanz ↔ Zeit bis zum Nutzen | Mehr Registrierungen ohne entsprechenden Nutzen für die Nutzenden. |
Das Ziel besteht nicht darin, beide Messgrößen unbegrenzt zu steigern. Der Zielkonflikt soll sichtbar werden, bevor eine einseitige Optimierung ein operatives Problem verursacht.
Eine ähnliche Herausforderung trat bei der Implementierung eines Spielersupports für ein Mobile-Gaming-Unternehmen auf. Das System bearbeitete häufige Anliegen wie verlorene Spielfortschritte, Zahlungsstreitigkeiten und Kontozugriff.
Effizienzkennzahlen waren wichtig, weil das System in großem Umfang eingesetzt wurde. Spielersupport ist jedoch nicht nur eine operative Warteschlange. Spielende sind beim Erstkontakt oft frustriert, weil an anderer Stelle ihres Erlebnisses bereits etwas schiefgegangen ist.
Diese Ausgangslage verändert, wie Daten zur Kundenzufriedenheit interpretiert werden sollten. Eine Person, deren Anliegen korrekt gelöst wird, kann dennoch eine geringe Zufriedenheit angeben, weil sie überhaupt erst Spielfortschritte verloren hat. Wird diese Bewertung ohne Kontext gelesen, kann die Supportinteraktion für Frust verantwortlich gemacht werden, der bereits früher im Kundenerlebnis entstanden ist.
Das Team musste daher zwischen der anfänglichen Stimmung der Person und der Wirkung des Supporterlebnisses unterscheiden. Die hilfreichere Frage lautete nicht: „War die spielende Person zufrieden?“ Sondern: „Hat die Interaktion die Situation gegenüber der Ausgangslage verbessert?“
Dieser Vergleich kann helfen, produktbedingten Frust von der Qualität des Supports zu unterscheiden, sofern das Team beides zuverlässig messen kann.
KI-Produkte verändern sich, ihre Kennzahlen bleiben jedoch oft unverändert.
Während eines Pilotprojekts kann die zentrale Frage lauten, ob das System vertrauenswürdig genug ist, um weitere Investitionen zu rechtfertigen:
Erledigt es die Kernaufgabe zuverlässig?
Vertrauen die Nutzenden ihm genug, um es weiterzuverwenden?
Wie verhält es sich außerhalb der häufigsten Szenarien?
Können Fehler erkannt und sicher behoben werden?
Für diese Fragen eignen sich Paare wie:
Erfolg bei der Kernaufgabe ↔ Leistung in Sonderfällen;
Automatisierungsquote ↔ Quote menschlicher Eingriffe und
Abschlussgeschwindigkeit ↔ Vertrauen der Nutzenden.
Sobald das Produkt für den Betrieb wichtig wird, ändern sich die Fragen:
Lässt es sich skalieren, ohne die Qualität zu mindern?
Verbessert sich seine Wirtschaftlichkeit mit zunehmender Nutzung?
Bleibt die Leistung stabil, wenn die Akzeptanz wächst?
Finden menschliche Eingriffe an den richtigen Stellen statt?
Die entsprechenden Paare können sich dann verlagern zu:
Kosten je Interaktion ↔ bewertete Ergebnisqualität;
Nutzungsbreite ↔ Nutzungstiefe und
Automatisierungsquote ↔ operatives Risiko.
Frühe Kennzahlen sind nicht zwangsläufig falsch. Sie beantworten die Fragen, die in einer früheren Phase wichtig waren.
Das Risiko entsteht beim Übergang. Kennzahlen aus Pilotprojekten bleiben oft bestehen, weil die Teams mit ihrer Berichterstattung vertraut sind und niemand für ihre Abschaffung verantwortlich ist. Messgrößen, die einst das Lernen unterstützten, können allmählich zu reinen Prestige-Kennzahlen werden.
Paare sollten daher einen Lebenszyklus haben. Teams sollten sie für eine konkrete Entscheidung einführen, regelmäßig prüfen, ob sie noch einen wesentlichen Zielkonflikt zeigen, und sie abschaffen, wenn sich das Produkt oder die Entscheidung ändert.
KI-Systeme erfordern detaillierte Beobachtbarkeit, Warnmeldungen, Qualitätssicherung und Evaluation. Ohne diese Signale wäre es schwieriger, das Produkt sicher zu betreiben. Operative Überwachung ist jedoch nicht dasselbe wie die Messung für die Unternehmensleitung.
Die Überwachung hilft Teams, Vorfälle zu erkennen, Fehler nachzuverfolgen und das Systemverhalten zu verstehen. Entscheidungskennzahlen helfen Produkt- und Unternehmensverantwortlichen zu entscheiden, ob sie investieren, eingreifen, die Richtung ändern oder einen Zielkonflikt akzeptieren sollten.
Ein Unternehmen kann Hunderte technische und operative Signale überwachen und für eine bestimmte Produktentscheidung nur zwei oder drei gegenläufige Kennzahlenpaare hervorheben. Eine kleine Entscheidungsebene erleichtert die Priorisierung.
Der passende Prüfzyklus hängt vom Produkt ab. Bei einem neuen oder sich schnell verändernden System können wöchentliche Entscheidungsrunden nötig sein, bei einem ausgereiften Produkt monatliche oder vierteljährliche. Das Prinzip ist wichtiger als das Intervall: Prüft das Paar oft genug, um zu handeln, bevor der Zielkonflikt teuer oder unsicher wird.
Ein Paar wird erst nützlich, wenn das Unternehmen vereinbart, was bei einer Verschlechterung geschieht.
Dafür reicht es nicht, einen Grenzwert für die Abweichung festzulegen. Teams sollten drei Bedingungen berücksichtigen:
Absolutes Versagen: Eine Messgröße überschreitet unabhängig von der anderen einen unzulässigen Grenzwert.
Abweichung: Eine Messgröße verbessert sich, während sich ihr Gegengewicht verschlechtert.
Gemeinsame Verschlechterung: Beide Seiten verschlechtern sich, was auf ein allgemeineres Produkt- oder Betriebsproblem hindeutet.
Jedes Paar sollte Folgendes haben:
eine benannte verantwortliche Person;
eine klare Entscheidung, die es unterstützt;
vereinbarte Grenzwerte oder Bewertungskriterien;
einen Untersuchungsablauf und
eine Reihe möglicher Maßnahmen.
Ohne diese Elemente beobachtet das Unternehmen das Produkt nur, statt es zu steuern.
Bevor ihr eine weitere Messgröße hinzufügt, wählt eine wichtige Produktentscheidung aus und arbeitet diese Fragen durch. Haltet die Antworten schriftlich fest, damit die Prüfung mit einem vereinbarten nächsten Schritt endet.
1. Bei welcher Entscheidung sollen uns diese Kennzahlen helfen?
Seid konkret: Entscheiden wir, ob wir die Automatisierung ausweiten, ein Modell wechseln oder die Übergabe an Menschen verbessern? Benennt die Entscheidung, bevor ihr die Messgrößen auswählt.
2. Was könnte sich verschlechtern, wenn sich diese Zahl verbessert?
Bestimmt das Ergebnis, das ihr schützen müsst, und eine Messgröße, die negative Auswirkungen sichtbar macht. Kombiniert beispielsweise die Kosten je Interaktion mit der bewerteten Ergebnisqualität, um zu prüfen, ob günstigere Antworten weiterhin nützlich sind.
3. Was könnten die Hauptkennzahlen verbergen?
Betrachtet beide Messgrößen für dieselben Personen, Aufgaben und Zeiträume. Sucht dann nach Gruppen, deren Ergebnisse schlechter ausfallen. Berücksichtigt auch die Ausgangslage: Eine geringe Zufriedenheit kann auf Frust zurückgehen, der schon vor der Supportinteraktion bestand.
4. Was würde uns zum Handeln veranlassen und wer ist für die Reaktion verantwortlich?
Legt Handlungskriterien für den Fall fest, dass eine Messgröße eine unzulässige Grenze überschreitet, sich eine verbessert und die andere verschlechtert oder beide nachlassen. Vereinbart, wer die Ursache untersucht, was zuerst geprüft wird und wann die Ergebnisse vorgelegt werden.
5. Passt dieses Paar noch zur aktuellen Phase des Produkts?
Entscheidet, ob ihr es beibehaltet, ersetzt oder abschafft. Bei einem Pilotprojekt können die Zuverlässigkeit der Aufgabenerledigung und das Vertrauen der Nutzenden im Mittelpunkt stehen. Ein aktiver Dienst erfordert möglicherweise eine genauere Prüfung von Kosten und Qualität. Legt einen Termin fest, um die Entscheidung erneut zu prüfen.
Die Messung von KI-Produkten sollte mehr leisten, als ihre Leistung zu beschreiben. Sie sollte die Zielkonflikte des Unternehmens sichtbar machen und die nächste Entscheidung erleichtern.