增加指標不一定能增進理解。許多儀表板包含多項衡量相同底層行為的指標。將指標組成相互制衡的配對,更有助於診斷問題,例如成本與品質、問題自行解決率與客戶情緒,或準確度與延遲。
AI 產品從試行走向正式上線時,合適的指標配對也會改變。衡量方式應配合團隊在各階段需要做的決策。
營運監控與策略衡量各有不同目的。團隊可能追蹤數百項系統訊號,但只用少數幾組配對來引導產品決策。
關鍵指標或許能呈現令人信服的成果,卻仍未解決重要的產品決策。
外界曾將 Klarna 的 AI 助理與更高的吞吐量、更低的成本,以及媲美真人客服的客戶滿意度分數連結在一起。隔年,該公司決定增加真人客服管道;執行長也承認,先前過度著重降低成本。
這並非否定該 AI 助理或背後的技術,而是公司在營運產品、累積經驗的過程中,調整自動化與真人服務之間的平衡。隨著自動化系統接手更多數量龐大、較為簡單的詢問,Klarna 需要的真人客服人員是能夠處理複雜、敏感案件的人才。
從一開始便定義好產品應達成的目標後,多數開發 AI 產品的組織最終都會面對同一個問題:產品真的有效嗎?
如果答案不明確,直覺反應通常是增加更多指標。3 項變成 10 項,再從 10 項變成 30 項。儀表板資訊更豐富了,團隊的理解卻未必有所提升。
問題不一定出在個別指標的品質,而可能在於指標之間的關係。客戶滿意度、淨推薦分數、評論與按讚率都能提供實用訊號,但它們可能反映的是整體情緒的相似變化。當這些指標同步變化時,只能證實有事情發生,卻不一定能解釋原因。
因此,AI 團隊不應只看彼此一致的指標,還應找出能揭露相互競爭結果的衡量方式。這些相互制衡的配對能揭露並協助監控產品效能背後取捨所造成的影響,讓團隊做出更好的決策。
在一項上線前的部署中,聯合團隊正為客服來電開發即時 AI 語音智慧體。最棘手的問題之一並非模型選擇或協調作業。而是客戶開始大規模使用後,組織要如何判斷產品是否有效。
最初的架構採用三項指標:
問題自行解決率:AI 無須轉接真人便能解決來電的頻率。
轉接率:來電轉接真人客服的頻率。
問題解決率:客戶問題最終獲得解決的頻率。
每項指標本身都很合理。但放在一起,仍無法回答一個顯而易見的問題:如果轉接率上升,這代表什麼?
團隊將轉接細分為八種類型。接著又加入中途放棄、歷程與時間指標、語言理解分數,以及各查詢類型的問題解決率。這套架構最終涵蓋六個類別,共 31 項指標。
它能詳細描述轉接情況,卻仍無法可靠地診斷原因。多數指標只是同一行為的不同版本,因此會同步變化,而不是檢驗相互競爭的解釋。
儀表板已變得只能觀察,無法診斷。
團隊需要的並不是再多一層細分。他們需要的是能彼此制約的指標。
我們稱之為相互制衡的配對:若只單獨改善其中一項指標,可能損害另一項指標所代表的結果。這個名稱描述的是單方面最佳化造成的失效模式,而不是理想狀態。
當兩邊都維持良好,產品可能正以可持續的方式運作。當兩者走勢分歧時,分歧的方向有助於團隊判斷該從何處展開調查。
原有指標 | 相互制衡的配對 | 配對可能揭露的問題 |
|---|---|---|
細分為八種類型的轉接率 | 轉接率 ↔ 轉接所需時間 | 立即轉接可能表示信任或呈現方式有問題;較晚轉接則可能表示系統無法完成任務。 |
分開呈報問題自行解決率與問題解決率 | 問題自行解決率 ↔ 客戶情緒 | 判斷問題自行解決代表的是令人滿意的處理結果,還是客戶放棄嘗試。 |
各意圖類型的問題解決率 | 問題解決率 ↔ 對話深度 | 判斷成功解決問題的過程是否有效率,還是需要令人疲憊的互動。 |
若要深入瞭解這些問題如何顯現,以及如何運用這項洞見,不妨以轉接率和轉接所需時間為例。在實際來電出現前,團隊無法得知客戶會如何行動,但可以先定義需要驗證的假設。
如果更多來電開始轉接,而且客戶在前 30 秒內便離開 AI 互動流程,團隊應調查信任、資訊揭露、語氣和開場互動。如果客戶嘗試執行任務數分鐘後才要求轉接,更可能是能力或工作流程涵蓋範圍出了問題。
關鍵的轉接數字相同。但產品決策不同。
實用的指標配對本身無法證明原因。它能縮小調查範圍,並讓下一項決策更明確。
前述 Klarna 案例顯示,成本與服務品質相互影響時,如何運用這項原則。這也說明企業如何在監控取捨的影響並從部署中學習的過程中,逐步調整 AI 驅動的營運模式。
2024 年 2 月,該公司表示,AI 助理在上線首月處理了 230 萬次對話,完成的工作量相當於 700 名全職客服人員,客戶滿意度分數也與真人客服相當。Klarna 估計,這款助理將在 2024 年帶來 4,000 萬美元的利潤改善。這些是 Klarna 自行公布的成果,並非獨立評估。
2025 年 5 月,Klarna 執行長表示,公司過度著重降低客服成本,並說明了增加真人客服管道的計畫。這代表公司調整自動化與真人服務之間的平衡,而不是否定 AI 助理或其底層技術。
公開證據說明,評估效率指標時,為何也應考量不同客戶與互動的需求。AI 系統的平均表現可能很好,但某些複雜、敏感或罕見的情況,仍可受益於方便使用的真人服務管道。
同時監控這段關係的兩端,有助於企業判斷自動化能在哪裡創造價值、哪些地方仍需要真人支援,以及出現新證據時應如何調整平衡。
AI 產品中的其他相互制衡配對可能包括:
相互制衡的配對 | 有助揭露的風險 |
|---|---|
回應準確度 ↔ 回應延遲 | 系統在技術上準確,對工作流程而言卻太慢。 |
任務完成率 ↔ 使用者覆寫率 | AI 工作流程雖完成了任務,使用者卻一再重新處理。 |
每次互動成本 ↔ 經評估的輸出品質 | 以犧牲客戶或員工體驗換取成本節省。 |
採用率 ↔ 實現價值所需時間 | 註冊人數增加,使用者獲得的價值卻未相應成長。 |
目的並不是讓兩項指標無止境地上升。而是要在單方面最佳化造成營運問題前,讓取捨清楚可見。
在一家行動遊戲公司的玩家支援部署中,也出現了相關挑戰。系統處理大量問題,例如遊戲進度遺失、付款爭議和帳戶存取。
由於系統大規模運作,效率指標十分重要。但玩家支援不只是一個營運工作佇列。玩家前來求助時往往已感到挫折,因為他們先前的體驗中已有其他環節出錯。
這種起始狀況會改變客戶滿意度資料的解讀方式。即使問題獲得正確解決,玩家仍可能因一開始就失去遊戲進度而回報低滿意度。若脫離脈絡解讀這個分數,可能會把客戶歷程早期產生的挫折感歸咎於客服互動。
因此,團隊必須區分客戶一開始的情緒,以及客服體驗所帶來的影響。更有用的問題不是:「玩家滿意嗎?」而是:「相較於玩家一開始的狀況,這次互動是否讓情況有所改善?」
只要團隊能可靠地衡量兩者,這項比較便有助於區分產品造成的挫折與客服品質。
AI 產品會改變,但其指標往往維持不變。
在試行階段,核心問題可能是系統是否足夠可靠,值得繼續投資:
它能可靠地完成核心任務嗎?
使用者是否充分信任它,願意繼續使用?
面對最常見情境以外的狀況時,它表現如何?
能否識別失效並安全復原?
這些問題適合採用以下配對:
核心任務成功率 ↔ 邊緣案例表現;
自動化率 ↔ 真人介入率;以及
完成速度 ↔ 使用者信心。
產品在營運上變得重要後,問題也會改變:
它能在不降低品質的情況下擴大規模嗎?
使用量增加時,經濟效益是否改善?
隨著採用率提高,效能是否維持穩定?
真人是否在適當環節介入?
相應的指標配對可能轉為:
每次互動成本 ↔ 經評估的輸出品質;
採用廣度 ↔ 使用深度;以及
自動化率 ↔ 營運風險曝險程度。
早期使用的指標不一定有錯。它們回答的是較早階段的重要問題。
風險出現在轉換階段。試行階段的指標往往會延續下來,因為團隊熟悉其呈報方式,卻沒有人負責決定何時停用。原本有助於學習的衡量方式,可能逐漸淪為虛榮指標。
因此,指標配對也應有生命週期。團隊應針對明確的決策導入配對,定期檢視它們是否仍能揭露重大取捨,並在產品或決策改變時停用。
AI 系統需要詳盡的可觀測性、警示、品質保證與評估。移除這些訊號,將使產品更難以安全營運。但營運監控與管理階層的衡量並不相同。
監控能協助團隊偵測事件、追查失效原因並瞭解系統行為。決策指標則協助產品與業務主管判斷該投資、介入、改變方向,還是接受某項取捨。
組織可以監控數百項技術與營運訊號,但針對特定產品決策,只需將兩三組相互制衡的配對列為重點。精簡決策層的指標,更容易排定優先順序。
適當的檢視頻率取決於產品。全新或快速變化的系統可能需要每週檢視決策,成熟產品則可以每月或每季檢視。原則比間隔更重要:檢視頻率應足以讓團隊在取捨造成高昂成本或安全風險前採取行動。
組織就配對惡化時的處置方式達成共識後,這組配對才真正有用。
這不只是為分歧設定紅線。團隊應考量三種情況:
絕對失效:無論另一項指標如何,其中一項已超出不可接受的門檻。
走勢分歧:一項指標改善,與之制衡的指標卻惡化。
共同惡化:兩邊同時下滑,表示產品或營運可能存在更廣泛的問題。
每組配對都應具備:
明確指派的負責人;
其支援的明確決策;
議定的門檻或評估準則;
調查路徑;以及
一套可能的介入措施。
缺少這些要素,組織便只是在觀察產品,而不是管理產品。
增加指標前,先選定一項重要的產品決策,再逐一回答以下問題。寫下答案,確保檢視結束時能就下一步達成共識。
1. 我們需要這些指標協助做出哪項決策?
請具體說明:我們要決定擴大自動化、更換模型,還是改善真人接手流程?先說明要做的決策,再選擇衡量指標。
2. 如果這個數字改善,什麼可能變差?
找出需要保護的結果,以及能揭露負面影響的指標。例如,將每次互動成本與經評估的輸出品質配對,以確認成本較低的答案是否仍有用。
3. 關鍵數字可能掩蓋了什麼?
針對相同使用者、任務與時段檢視兩項指標,再找出結果較差的群體。也要考量起始狀況:滿意度偏低,可能反映的是客服互動開始前就已存在的挫折感。
4. 什麼情況會促使我們採取行動?由誰負責因應?
針對指標超出不可接受的界線、一項改善而另一項惡化,或兩項同時惡化等情況,設定行動準則。議定由誰調查、優先檢查什麼,以及何時回報。
5. 這組配對仍符合產品目前的階段嗎?
決定要保留、替換還是停用。試行階段可能著重任務可靠性與使用者信心;正式服務則可能需要更密切檢視成本與品質。訂下重新檢視這項選擇的日期。
AI 產品的衡量不應只描述效能。它還應揭露組織正在做的取捨,並讓下一項決策更明確。