開發 AI 產品時監察取捨帶來的影響

揭示隱藏的取捨,有助團隊診斷 AI 產品失效原因並作出更佳決策。

管理層重點

  • 增加指標不一定有助理解。許多資訊主頁包含多項衡量同一基本行為的指標。將指標組成相互損害的指標配對,更有助診斷問題,例如成本與質素、自主處理率與客戶情緒,或準確度與延遲。

  • 隨着 AI 產品從試行階段邁向正式投入運作,合適的指標配對亦會改變。衡量方式應配合團隊在各階段需要作出的決策。

  • 營運監察與策略衡量各有不同目的。團隊或會追蹤數百項系統訊號,但只用幾組配對來指導產品決策。

主要指標可以呈現具說服力的結果,卻仍未能幫助團隊就重要的產品問題作出決策。

公開資料曾指出,Klarna 的 AI 助理提高了處理量、降低了成本,客戶滿意度評分亦與客戶服務人員相若。翌年,該公司決定讓客戶更容易獲得真人支援,其行政總裁亦承認過度側重削減成本。

這並非否定該 AI 助理或其基礎技術。這是公司從產品營運中汲取經驗後,對自動化與真人服務之間的平衡所作的調整。隨着數量龐大而較簡單的查詢越來越多由自動化處理,Klarna 需要的是有能力處理複雜、敏感個案的客戶服務人員。

更多指標不一定帶來更清晰的理解

大多數開發 AI 產品的機構即使一開始已訂明產品應達成的目標,最終仍會面對同一問題:產品實際上是否有效?

如果答案不明確,直覺反應通常是增加更多指標。3 項變成 10 項,再由 10 項增至 30 項。資訊主頁的資料更豐富,團隊的理解卻未必有所提升。

問題不一定在於個別衡量指標的質素,而在於它們之間的關係。客戶滿意度、淨推薦值、評論和讚好率都能提供有用訊號,但它們可能只反映整體情緒的相似變化。當這些指標同步變動時,只能確認某些事情已發生,卻不一定能解釋原因。

因此,AI 團隊不應只看走勢一致的指標,亦應找出能揭示不同結果之間矛盾的指標。這些相互損害的指標配對能揭示並協助監察產品表現背後各項取捨的影響,從而改善決策。

開發實時語音智能代理時監察取捨:當更多指標不再奏效

在一次推出前的部署中,聯合團隊正開發一款處理客戶支援來電的實時 AI 語音智能代理。其中一個最棘手的問題並非選擇模型或協調運作。問題在於,客戶開始大規模使用產品後,機構如何判斷產品是否有效。

最初的框架採用三項指標:

  • 自主處理率:AI 無需將來電轉駁真人便能解決問題的比例。

  • 轉交率:來電轉交客戶服務人員的比例。

  • 問題解決率:客戶問題最終獲得解決的比例。

每項指標本身都合理。然而,三者合起來仍無法回答一個顯而易見的問題:如果轉交率上升,這代表甚麼?

團隊將轉交情況細分為八種類型。其後再加入放棄、流程及時間指標、語言理解評分,以及按查詢類型劃分的問題解決率。這套框架最終涵蓋六個類別、合共 31 項指標。

這套框架能詳細描述轉交情況,卻仍無法可靠地診斷成因。大部分指標只是從不同角度衡量同一行為,因此會同步變動,而不能用來驗證各種可能的解釋。

資訊主頁已變成只供觀察,而非用於診斷。

利用相互損害的指標配對揭示取捨

團隊需要的並非進一步細分。他們需要的是能相互制衡的指標。

我們稱之為相互損害的指標配對:兩項衡量指標之中,若只求改善其中一項,便可能損害另一項所代表的結果。這個名稱描述的是單方面優化造成的失效模式,而非理想狀態。

當兩方面都保持穩健,產品或能持續穩定運作。當兩者走勢分歧,分歧的方向便有助團隊決定應從何處調查。

原有指標

相互損害的指標配對

配對可能揭示的情況

細分為八種類型的轉交率

轉交率 ↔ 轉交所需時間

即時轉交可能反映信任或表述方式出現問題;較後才轉交則可能表示系統無法完成任務。

分開報告自主處理率和問題解決率

自主處理率 ↔ 客戶情緒

沒有轉交真人,究竟代表問題獲妥善解決,還是客戶放棄嘗試。

按意圖類型劃分的問題解決率

問題解決率 ↔ 對話深度

成功解決問題的過程是否有效率,抑或需要經歷令人疲憊的互動。

要深入了解配對如何揭示問題,以及如何運用這項洞見,不妨考慮轉交率與轉交所需時間。在接獲真實來電前,團隊無法得知客戶會如何行動,但可以先訂立需要驗證的假設。

如果更多來電開始被轉交,而客戶在最初 30 秒內便離開 AI 體驗,團隊應調查信任、資訊披露、語調和開場互動。如果客戶嘗試執行任務數分鐘後才要求轉交,問題便較可能出在系統能力或工作流程涵蓋範圍。

整體轉交數字相同,產品決策卻不同。

有用的配對本身不能證明成因。它能收窄調查範圍,並令下一項決策更清晰。

成本與質素需要一併解讀

先前提到的 Klarna 案例,說明這項原則如何適用於成本與服務質素互相影響的情況。這顯示公司監察取捨的影響並從部署中學習時,採用 AI 的營運模式可以如何演變。

2024 年 2 月,該公司報告指其 AI 助理在首月處理了 230 萬次對話,完成相當於 700 名全職客戶服務人員的工作量,客戶滿意度評分亦與客戶服務人員相若。Klarna 估計該助理將於 2024 年帶來 4,000 萬美元的利潤增長。這些是 Klarna 自行報告的結果,並非獨立評估。

2025 年 5 月,Klarna 的行政總裁表示,公司在客戶服務方面過度側重削減成本,並公佈讓客戶更容易獲得真人支援的計劃。這代表公司調整自動化服務與真人服務之間的平衡,而非否定 AI 助理或其基礎技術。

公開資料說明,考慮效率指標時,為何亦應顧及不同客戶和互動的需要。AI 系統的平均表現可能良好,但部分複雜、敏感或罕見的個案,仍能受惠於方便使用的真人支援渠道。

監察這項關係的兩方面,有助公司決定自動化在哪些環節創造價值、真人支援在哪些環節仍然重要,以及在新證據出現時應如何調整平衡。

AI 產品的其他相互損害的指標配對可能包括:

相互損害的指標配對

有助揭示的風險

回應準確度 ↔ 回應延遲

系統在技術上準確,速度卻太慢,無法配合工作流程。

任務完成率 ↔ 用戶覆寫率

AI 工作流程完成任務後,用戶卻一再重做。

每次互動成本 ↔ 經評估的輸出質素

以犧牲客戶或員工體驗來節省成本。

採用率 ↔ 實現價值所需時間

登記人數增長,卻沒有帶來相應的用戶價值。

目的並非讓兩項指標無限上升。而是在單方面優化造成營運問題前,讓相關取捨清楚可見。

客戶的起始狀況會改變指標的含義

一家流動遊戲公司的玩家支援部署亦出現相關挑戰。系統處理大量問題,例如遊戲進度遺失、付款爭議和帳戶存取。

由於系統大規模運作,效率指標十分重要。然而,玩家支援並不只是按序處理輪候中的查詢。玩家尋求支援時往往已感到不滿,因為他們的使用體驗在其他環節已經出現問題。

這個起始狀況會影響客戶滿意度數據的解讀方式。即使問題得到正確解決,玩家仍可能因最初遺失遊戲進度而給予偏低的滿意度評分。脫離情境解讀這項評分,可能會把客戶歷程早期產生的不滿歸咎於支援互動。

因此,團隊需要區分客戶最初的情緒與支援體驗帶來的影響。更有用的問題並非:「玩家滿意嗎?」而是:「相對於玩家最初的狀況,這次互動有否令情況改善?」

只要團隊有可靠方法衡量兩者,這項比較便有助區分產品造成的不滿與支援質素。

衡量方式應隨產品改變

AI 產品不斷改變,衡量指標卻往往維持不變。

試行期間,核心問題可能是系統是否足夠可靠,值得繼續投資:

  • 系統能否可靠地完成核心任務?

  • 用戶對系統的信任是否足以讓他們繼續使用?

  • 系統在最常見情境以外的表現如何?

  • 能否識別故障並安全地復原?

這些問題適合採用以下配對:

  • 核心任務成功率 ↔ 邊緣個案表現;

  • 自動化率 ↔ 人工覆寫率;以及

  • 完成速度 ↔ 用戶信心。

產品在營運上變得重要後,問題亦會改變:

  • 產品能否在不降低質素的情況下擴展規模?

  • 使用量增加時,其經濟效益會否改善?

  • 採用率增長時,表現能否保持穩定?

  • 真人介入是否出現在合適的環節?

相應的配對可能轉為:

  • 每次互動成本 ↔ 經評估的輸出質素;

  • 採用廣度 ↔ 使用深度;以及

  • 自動化率 ↔ 營運風險承擔程度。

早期指標不一定有問題。它們解答的是早期階段的重要問題。

風險出現在過渡期間。試行階段的指標往往被沿用,因為團隊熟悉其匯報方式,亦沒有人負責決定何時停用。原本有助學習的衡量指標,可能逐漸淪為虛榮指標。

因此,指標配對亦應有其生命週期。團隊應針對明確的決策引入配對,檢視它們能否繼續揭示重大取捨,並在產品或決策改變時停用。

監察與決策是不同層面

AI 系統需要完善的可觀測性、警報、質素保證及評估機制。移除這些訊號,將令產品更難安全運作。然而,營運監察並不等同管理層用來作出決策的衡量方式。

監察有助團隊偵測事故、追查故障並了解系統行為。決策指標則協助產品及業務領袖決定是否投資、介入、轉變方向或接受取捨。

機構可能一方面監察數百項技術和營運訊號,另一方面只選取兩至三組相互損害的指標配對,作為某項產品決策的依據。精簡這一層面的決策指標,有助釐定優先次序。

合適的檢討頻率視乎產品而定。全新或迅速轉變的系統可能需要每星期檢討決策,而成熟產品則可每月或每季檢討。原則比相隔時間更重要:檢討配對的頻率應足以讓團隊在取捨造成高昂成本或安全風險前採取行動。

訂明配對應觸發的行動

只有當機構議定配對惡化時應採取甚麼行動,配對才真正有用。

這不僅需要為分歧訂立紅線。團隊應考慮三種情況:

  • 絕對失效:無論另一項指標如何,其中一項已越過不可接受的門檻。

  • 走勢分歧:其中一項指標改善,其制衡指標卻惡化。

  • 共同惡化:兩方面同時下跌,顯示可能存在更廣泛的產品或營運問題。

每組配對都應具備:

  • 一名明確指定的負責人;

  • 一項明確支援的決策;

  • 議定的門檻或評估準則;

  • 一套調查流程;以及

  • 一系列可行的介入措施。

缺少這些元素,機構便只是在觀察產品,而非管理產品。

下次檢討指標時要問的五個問題

加入另一項指標前,先選定一項重要的產品決策,再逐一回答以下問題。寫下答案,確保檢討結束時能議定下一步。

1. 我們需要這些指標協助作出哪項決策?

具體說明:我們要決定的是擴大自動化、變更模型,還是改善轉交真人的流程?選擇衡量指標前,先訂明要作出的決策。

2. 如果這個數字改善,甚麼可能會變差?

找出需要保護的結果,以及能揭示損害的衡量指標。例如,將每次互動成本與經評估的輸出質素配對,以檢查成本較低的答案是否仍然有用。

3. 主要數字可能掩蓋了甚麼?

針對相同用戶、任務和時段同時解讀兩項指標,再找出結果較差的群組。亦要考慮起始狀況:滿意度偏低,可能源於支援互動開始前已存在的不滿。

4. 甚麼情況會促使我們行動?由誰負責應對?

訂立行動準則,以應對某項指標越過不可接受的界線、一項改善而另一項惡化,或兩者同時惡化的情況。議定由誰調查、首先檢查甚麼,以及何時匯報結果。

5. 這組配對是否仍適合產品目前所處的階段?

決定保留、取代還是停用這組配對。試行階段可能聚焦於任務可靠性和用戶信心;正式運作的服務則可能需要更仔細審視成本和質素。訂立重新檢視這項選擇的日期。

AI 產品衡量不應只描述表現。它亦應揭示機構正在作出的取捨,令下一項決策更清晰。

Authors

Ale Zacarias, Josie Steer