Dodanie wskaźników nie zawsze poprawia zrozumienie sytuacji. Wiele pulpitów zawiera kilka miar tego samego zachowania bazowego. Wskaźniki mają większą wartość diagnostyczną, gdy łączy się je w pary wzajemnie destrukcyjne: koszt z jakością, samodzielną obsługę z nastawieniem klienta lub dokładność z opóźnieniem.
Właściwe pary zmieniają się wraz z przechodzeniem produktu AI od pilotażu do eksploatacji. Pomiary powinny odpowiadać decyzjom, które zespół musi podejmować na każdym etapie.
Monitorowanie operacyjne i pomiary strategiczne służą różnym celom. Zespoły mogą śledzić setki sygnałów systemowych, a przy podejmowaniu decyzji produktowych kierować się zaledwie kilkoma parami.
Główne wskaźniki mogą tworzyć przekonującą narrację, a zarazem nie rozstrzygać ważnej decyzji produktowej.
Publicznie kojarzono asystenta AI firmy Klarna z większą przepustowością, niższymi kosztami i wynikami satysfakcji klientów porównywalnymi z wynikami ludzkich konsultantów. W następnym roku firma postanowiła zwiększyć dostępność pomocy udzielanej przez ludzi, a jej dyrektor generalny przyznał, że zbyt mocno skupiono się na obniżaniu kosztów.
Nie oznaczało to odrzucenia asystenta AI ani technologii, na której go oparto. Firma skorygowała równowagę między automatyzacją a obsługą przez ludzi, wyciągając wnioski z eksploatacji produktu. W miarę jak automatyzacja przejmowała coraz więcej prostszych zapytań o dużym wolumenie, Klarna potrzebowała konsultantów przygotowanych do obsługi złożonych, delikatnych spraw.
Po określeniu od samego początku, co produkt ma osiągnąć, większość organizacji tworzących produkty AI staje w końcu przed tym samym pytaniem: czy to rzeczywiście działa?
Jeśli odpowiedź nie jest jasna, odruchowo dodaje się kolejne wskaźniki. Z trzech robi się 10, a potem z 10 — 30. Pulpit zawiera coraz więcej danych, ale zespół niekoniecznie lepiej rozumie sytuację.
Problem nie zawsze tkwi w jakości poszczególnych miar, lecz w relacjach między nimi. Satysfakcja klientów, Net Promoter Score, recenzje i odsetek pozytywnych ocen mogą dostarczać użytecznych sygnałów, ale często odzwierciedlają podobne zmiany ogólnego nastawienia. Gdy zmieniają się w tym samym kierunku, potwierdzają, że coś się wydarzyło, ale niekoniecznie wyjaśniają dlaczego.
Zespoły AI powinny zatem wykraczać poza zgodne ze sobą wskaźniki i szukać miar ujawniających konkurencyjne rezultaty. Takie wzajemnie destrukcyjne pary ujawniają skutki kompromisów wpływających na wyniki produktu i ułatwiają ich monitorowanie, co pozwala podejmować lepsze decyzje.
W jednym z wdrożeń przedpremierowych wspólny zespół opracowywał agenta głosowego AI działającego w czasie rzeczywistym i obsługującego przychodzące połączenia do działu pomocy. Jedno z najtrudniejszych pytań nie dotyczyło wyboru modelu ani orkiestracji. Dotyczyło tego, skąd organizacja będzie wiedzieć, czy produkt działa, gdy klienci zaczną z niego korzystać na dużą skalę.
Początkowa struktura obejmowała trzy miary:
Wskaźnik samodzielnej obsługi: jak często AI rozwiązuje sprawę podczas rozmowy bez przekazywania jej człowiekowi.
Wskaźnik eskalacji: jak często rozmowa jest przekazywana ludzkiemu konsultantowi.
Wskaźnik rozwiązania spraw: jak często problem klienta zostaje ostatecznie rozwiązany.
Każda z tych miar była uzasadniona. Razem nie pozwalały jednak odpowiedzieć na oczywiste pytanie: co oznacza wzrost liczby eskalacji?
Zespół podzielił eskalacje na osiem podtypów. Następnie dodał miary rezygnacji, przebiegu obsługi i czasu, wyniki rozumienia języka oraz odsetek rozwiązanych spraw według typu zapytania. Ostatecznie struktura obejmowała 31 wskaźników w sześciu kategoriach.
Pozwalała szczegółowo opisać eskalacje, ale nadal nie umożliwiała wiarygodnego rozpoznania ich przyczyn. Większość wskaźników była wariantami tego samego zachowania, więc zmieniały się wspólnie, zamiast weryfikować konkurencyjne wyjaśnienia.
Pulpit służył już tylko do obserwacji, a nie do diagnozy.
Zespół nie potrzebował kolejnego poziomu szczegółowości. Potrzebował wskaźników, które wzajemnie się ograniczają.
Nazywamy je parami wzajemnie destrukcyjnymi: są to dwie miary, z których poprawianie jednej w oderwaniu od drugiej może zaszkodzić reprezentowanemu przez nią rezultatowi. Nazwa opisuje rodzaj niepowodzenia wywołanego jednostronną optymalizacją, a nie pożądany stan.
Jeśli obie strony pozostają na dobrym poziomie, produkt może działać w sposób zrównoważony. Gdy zaczynają się rozchodzić, kierunek tej rozbieżności wskazuje zespołowi, co należy zbadać.
Co mieliśmy | Para wzajemnie destrukcyjna | Co może ujawnić para |
|---|---|---|
Wskaźnik eskalacji podzielony na osiem podtypów | Wskaźnik eskalacji ↔ czas do eskalacji | Natychmiastowa eskalacja może wskazywać na problem z zaufaniem lub sposobem przedstawienia usługi, natomiast późniejsza — na niezdolność systemu do wykonania zadania. |
Wskaźnik samodzielnej obsługi i wskaźnik rozwiązania spraw raportowane oddzielnie | Wskaźnik samodzielnej obsługi ↔ nastawienie klienta | Czy samodzielna obsługa oznacza satysfakcjonujące rozwiązanie, czy rezygnację klienta z dalszych prób. |
Wskaźnik rozwiązania spraw według rodzaju intencji | Wskaźnik rozwiązania spraw ↔ długość rozmowy | Czy skuteczne rozwiązanie jest sprawne, czy wymaga wyczerpującej interakcji. |
Aby dokładniej przyjrzeć się temu, jak ujawnia się ten mechanizm i jak wykorzystać uzyskane informacje, rozważmy wskaźnik eskalacji oraz czas do eskalacji. Zespół nie będzie wiedział, jak zachowują się klienci, dopóki nie pojawią się prawdziwe połączenia, ale może określić hipotezy wymagające sprawdzenia.
Jeśli coraz więcej rozmów jest eskalowanych, a klienci opuszczają środowisko AI w ciągu pierwszych 30 sekund, zespół powinien zbadać kwestie zaufania, informowania o AI, tonu i początku interakcji. Jeśli klienci eskalują sprawę po kilku minutach prób wykonania zadania, bardziej prawdopodobnym problemem jest zakres możliwości lub obsługiwanych procesów.
Główna wartość wskaźnika eskalacji jest taka sama. Inna jest decyzja produktowa.
Użyteczna para sama w sobie nie dowodzi przyczyny. Zawęża zakres dochodzenia i ułatwia podjęcie kolejnej decyzji.
Przytoczony wcześniej przykład firmy Klarna pokazuje, jak ta zasada działa w przypadku zależności między kosztami a jakością obsługi. Pokazuje, jak model operacyjny wykorzystujący AI może ewoluować, gdy firma monitoruje skutki kompromisów i wyciąga wnioski z wdrożenia.
W lutym 2024 roku firma poinformowała, że jej asystent AI obsłużył w pierwszym miesiącu 2,3 mln rozmów, wykonał pracę odpowiadającą pracy 700 pełnoetatowych konsultantów i uzyskał wyniki satysfakcji klientów porównywalne z wynikami ludzkich konsultantów. Klarna oszacowała, że w 2024 roku asystent przyczyni się do zwiększenia zysku o 40 mln USD. Były to wyniki podane przez samą firmę Klarna, a nie niezależna ocena.
W maju 2025 roku dyrektor generalny firmy Klarna powiedział, że firma zbyt mocno skupiała się na obniżaniu kosztów obsługi klienta, i przedstawił plany zwiększenia dostępności pomocy udzielanej przez ludzi. Oznaczało to korektę równowagi między obsługą automatyczną a obsługą przez ludzi, a nie odrzucenie asystenta AI ani technologii, na której go oparto.
Publicznie dostępne informacje pokazują, dlaczego miary efektywności należy rozpatrywać wraz z potrzebami różnych klientów i rodzajów interakcji. System AI może osiągać dobre wyniki średnie, choć w niektórych złożonych, wrażliwych lub nietypowych przypadkach nadal warto zapewnić łatwo dostępny kontakt z człowiekiem.
Monitorowanie obu stron tej relacji pomaga firmie ustalić, gdzie automatyzacja tworzy wartość, gdzie pomoc człowieka pozostaje ważna oraz jak zmieniać tę równowagę w świetle nowych danych.
Inne wzajemnie destrukcyjne pary stosowane w produktach AI mogą obejmować:
Para wzajemnie destrukcyjna | Ryzyko, które pomaga ujawnić |
|---|---|
Dokładność odpowiedzi ↔ opóźnienie odpowiedzi | System, który jest technicznie dokładny, ale zbyt wolny dla danego procesu. |
Wykonanie zadania ↔ odsetek korekt użytkownika | Proces AI wykonujący zadania, które użytkownicy wielokrotnie powtarzają samodzielnie. |
Koszt interakcji ↔ oceniana jakość wyników | Oszczędności osiągane kosztem pogorszenia doświadczeń klientów lub pracowników. |
Wdrożenie ↔ czas do uzyskania wartości | Wzrost liczby rejestracji bez proporcjonalnego wzrostu wartości dla użytkowników. |
Celem nie jest nieograniczony wzrost obu miar. Chodzi o uwidocznienie kompromisu, zanim jednostronna optymalizacja doprowadzi do problemu operacyjnego.
Podobne wyzwanie pojawiło się przy wdrożeniu pomocy dla graczy w firmie tworzącej gry mobilne. System obsługiwał masowo występujące problemy, takie jak utrata postępów, spory dotyczące płatności i dostęp do konta.
Miary efektywności były istotne, ponieważ system działał na dużą skalę. Pomoc dla graczy nie jest jednak zwykłą kolejką operacyjną. Gracze często zgłaszają się sfrustrowani, ponieważ wcześniej coś poszło nie tak podczas korzystania z gry.
Ta sytuacja początkowa zmienia sposób interpretowania danych o satysfakcji klientów. Gracz, którego problem został prawidłowo rozwiązany, może nadal nisko ocenić satysfakcję, ponieważ wcześniej utracił postępy. Interpretowanie takiej oceny bez kontekstu może niesłusznie obciążać kontakt z pomocą za frustrację powstałą wcześniej na ścieżce klienta.
Zespół musiał więc odróżnić początkowe nastawienie klienta od wpływu kontaktu z pomocą. Bardziej użyteczne pytanie nie brzmiało: „Czy gracz był zadowolony?”. Brzmiało ono: „Czy interakcja poprawiła sytuację gracza względem punktu wyjścia?”
Takie porównanie może pomóc odróżnić frustrację wywołaną produktem od jakości pomocy, pod warunkiem że zespół potrafi wiarygodnie mierzyć oba czynniki.
Produkty AI się zmieniają, ale ich wskaźniki często pozostają niezmienne.
Podczas pilotażu najważniejsze może być pytanie, czy system jest na tyle godny zaufania, aby uzasadnić dalsze inwestycje:
Czy niezawodnie wykonuje podstawowe zadanie?
Czy użytkownicy ufają mu na tyle, aby nadal z niego korzystać?
Jak zachowuje się poza najczęstszymi scenariuszami?
Czy można wykrywać awarie i bezpiecznie przywracać działanie?
Te pytania przemawiają za parami takimi jak:
powodzenie podstawowego zadania ↔ działanie w nietypowych przypadkach;
stopień automatyzacji ↔ odsetek interwencji człowieka; oraz
szybkość wykonania ↔ zaufanie użytkownika.
Gdy produkt zyskuje znaczenie operacyjne, pytania się zmieniają:
Czy może się skalować bez obniżania jakości?
Czy jego opłacalność rośnie wraz z użytkowaniem?
Czy wydajność pozostaje stabilna w miarę wzrostu skali wdrożenia?
Czy ludzie interweniują we właściwych miejscach?
Odpowiednie pary mogą wówczas obejmować:
koszt interakcji ↔ oceniana jakość wyników;
zasięg wdrożenia ↔ intensywność użytkowania; oraz
stopień automatyzacji ↔ narażenie na ryzyko operacyjne.
Wczesne wskaźniki nie muszą być błędne. Odpowiadają na pytania istotne na wcześniejszym etapie.
Ryzyko pojawia się w okresie przejściowym. Wskaźniki pilotażowe często pozostają w użyciu, ponieważ zespoły potrafią je raportować, a nikt nie odpowiada za decyzję o ich wycofaniu. Miary, które wcześniej wspierały naukę, mogą stopniowo stawać się wskaźnikami próżności.
Pary powinny więc mieć własny cykl życia. Zespoły powinny wprowadzać je na potrzeby konkretnej decyzji, sprawdzać, czy nadal ujawniają istotny kompromis, i wycofywać je, gdy zmienia się produkt lub decyzja.
Systemy AI wymagają szczegółowej obserwowalności, alertów, zapewniania jakości i oceny. Usunięcie tych sygnałów utrudniłoby bezpieczną eksploatację produktu. Monitorowanie operacyjne nie jest jednak tym samym co pomiary na potrzeby kadry kierowniczej.
Monitorowanie pomaga zespołom wykrywać incydenty, śledzić awarie i rozumieć zachowanie systemu. Wskaźniki decyzyjne pomagają liderom produktu i firmy rozstrzygać, czy inwestować, interweniować, zmieniać kierunek, czy zaakceptować kompromis.
Organizacja może monitorować setki sygnałów technicznych i operacyjnych, a na potrzeby konkretnej decyzji produktowej wyróżniać tylko dwie lub trzy wzajemnie destrukcyjne pary. Ograniczenie tej warstwy decyzyjnej ułatwia ustalanie priorytetów.
Właściwa częstotliwość przeglądów zależy od produktu. Nowy lub szybko zmieniający się system może wymagać cotygodniowych przeglądów decyzyjnych, natomiast w przypadku dojrzałego produktu wystarczą przeglądy miesięczne lub kwartalne. Zasada jest ważniejsza niż odstęp czasu: parę należy przeglądać na tyle często, aby zareagować, zanim kompromis stanie się kosztowny lub niebezpieczny.
Para staje się użyteczna dopiero wtedy, gdy organizacja uzgodni, co zrobi w razie pogorszenia wyników.
Nie wystarczy do tego określić krytycznego poziomu rozbieżności. Zespoły powinny uwzględnić trzy sytuacje:
Bezwzględne niepowodzenie: jedna z miar przekracza niedopuszczalny próg niezależnie od drugiej.
Rozbieżność: jedna miara się poprawia, a równoważąca ją druga — pogarsza.
Wspólne pogorszenie: obie strony się pogarszają, co wskazuje na szerszy problem produktowy lub operacyjny.
Każda para powinna mieć:
wyznaczonego właściciela;
jasno określoną decyzję, którą wspiera;
uzgodnione progi lub kryteria oceny;
określoną ścieżkę dochodzenia; oraz
zestaw możliwych interwencji.
Bez tych elementów organizacja jedynie obserwuje produkt, zamiast nim zarządzać.
Przed dodaniem kolejnej miary wybierz jedną ważną decyzję produktową i odpowiedz na poniższe pytania. Zapisz odpowiedzi, aby przegląd zakończył się uzgodnieniem następnego kroku.
1. W podjęciu jakiej decyzji mają nam pomóc te wskaźniki?
Określ to precyzyjnie: czy decydujemy o rozszerzeniu automatyzacji, zmianie modelu, czy usprawnieniu przekazywania spraw człowiekowi? Najpierw nazwij decyzję, a dopiero potem wybierz miary.
2. Co może się pogorszyć, jeśli ta wartość się poprawi?
Wskaż rezultat, który trzeba chronić, oraz miarę ujawniającą szkodę. Przykładowo połącz koszt interakcji z ocenianą jakością wyników, aby sprawdzić, czy tańsze odpowiedzi nadal są użyteczne.
3. Co mogą ukrywać główne wartości?
Analizuj obie miary dla tych samych użytkowników, zadań i okresów, a następnie szukaj grup osiągających gorsze wyniki. Uwzględniaj też sytuację początkową: niska satysfakcja może wynikać z frustracji, która pojawiła się jeszcze przed kontaktem z pomocą techniczną.
4. Co skłoni nas do działania i kto odpowiada za reakcję?
Ustal kryteria działania na wypadek przekroczenia przez miarę niedopuszczalnego progu, poprawy jednej miary przy pogorszeniu drugiej lub pogorszenia obu. Uzgodnij, kto przeprowadzi dochodzenie, co sprawdzi najpierw i kiedy przedstawi wyniki.
5. Czy ta para nadal odpowiada obecnemu etapowi rozwoju produktu?
Zdecyduj, czy ją zachować, zastąpić, czy wycofać. W pilotażu najważniejsze mogą być niezawodność wykonywania zadań i zaufanie użytkowników, natomiast działająca usługa może wymagać dokładniejszej kontroli kosztów i jakości. Wyznacz termin ponownego rozpatrzenia tej decyzji.
Pomiar produktów AI powinien nie tylko opisywać ich działanie. Powinien ujawniać kompromisy dokonywane przez organizację i ułatwiać podjęcie kolejnej decyzji.