构建 AI 产品时监控权衡的影响

揭示隐藏的权衡,有助于团队诊断 AI 产品未达预期的原因并做出更好的决策

管理层要点

  • 增加指标不一定能增进理解。许多仪表板包含多个衡量同一底层行为的指标。将指标组成相互制约的配对,更有助于诊断问题,例如成本与质量、未转人工率与客户情绪,或准确率与延迟。

  • 随着 AI 产品从试点走向生产,合适的指标配对也会变化。每个阶段衡量什么,应取决于团队需要做出哪些决策。

  • 运营监控与战略衡量的用途不同。团队可以跟踪数百个系统信号,但只用少数几组指标指导产品决策。

核心指标或许能讲出一个有说服力的故事,却仍无法为一项重要的产品决策提供明确依据。

在公开信息中,Klarna 的 AI 助手被认为提高了吞吐量、降低了成本,并取得了与人工客服相当的客户满意度得分。次年,该公司决定扩大人工支持渠道;其首席执行官承认,此前过度强调了降低成本。

这并不是对 AI 助手或其底层技术的否定,而是公司根据产品运营中积累的经验,调整了自动化服务与人工服务之间的平衡。随着大量相对简单的咨询逐步由自动化服务接手,Klarna 更需要能够处理复杂、敏感问题的人工客服。

指标越多,未必越清晰

在一开始明确产品应实现的目标后,大多数开发 AI 产品的组织最终都会面临同一个问题:它真的有效吗?

如果答案不明确,人们往往会本能地增加更多指标。3 个变成 10 个,10 个又变成 30 个。仪表板越来越丰富,但团队的理解未必有所加深。

问题并不总在于单项指标的质量,而在于指标之间的关系。客户满意度、净推荐值、评价和点赞率都能提供有用信号,但它们可能反映的是整体情绪的相似变化。当它们同步变化时,只能证明确实发生了某种变化,却未必能解释原因。

因此,AI 团队不应只关注相互印证的指标,还应找出能够揭示彼此竞争结果的衡量指标。这些相互制约的指标配对能够揭示并帮助监控产品性能背后的权衡影响,从而支持更好的决策。

构建实时语音智能体时监控权衡:更多指标为何不再奏效

在一次上线前部署中,联合团队正在开发一款用于接听客户支持来电的实时 AI 语音智能体。最棘手的问题之一并非如何选择或编排模型,而是当客户开始大规模使用后,组织如何判断产品是否有效。

初始框架采用了三个指标:

  • 未转人工率:由 AI 解决且无需转接人工客服的来电所占比例。

  • 升级率:转接人工客服的来电所占比例。

  • 解决率:客户问题最终得到解决的比例。

每个指标本身都合理。但把它们放在一起,仍无法回答一个显而易见的问题:升级率上升说明了什么?

团队将升级拆分为八个子类型。随后又增加了放弃率、客户旅程和时长指标、语言理解得分,以及按查询类型划分的解决率。该框架最终涵盖六个类别的 31 项指标。

它能详细描述升级情况,却仍无法可靠地诊断原因。大多数指标只是同一行为的不同呈现,因此会同步变化,而无法检验相互竞争的解释。

仪表板只能用于观察,而无法用于诊断。

用相互制约的指标配对揭示权衡

团队需要的并不是再增加一层拆解,而是能够相互制约的指标。

我们将其称为相互制约的指标配对:如果孤立地改善其中一项,就可能损害另一项所代表的结果。这里强调的是单边优化可能造成的损害,而非理想的运行状态。

如果两项指标都保持健康,产品或许正在可持续地运行。如果二者背离,背离的方向将帮助团队判断应从何处着手调查。

原有指标

相互制约的指标配对

该配对可能揭示什么

拆分为八个子类型的升级率

升级率 ↔ 升级所需时间

立即升级可能表明存在信任或表述方式问题;稍后升级则可能表明系统无法完成任务。

分别报告未转人工率和解决率

未转人工率 ↔ 客户情绪

未转人工究竟意味着问题得到了令人满意的解决,还是客户放弃了尝试。

按意图类型划分的解决率

解决率 ↔ 对话深度

成功解决问题是否高效,还是需要经历令人疲惫的交互。

为了深入了解这种关系如何显现,以及如何利用这一洞察,我们来考察升级率与升级所需时间。在收到真实来电之前,团队无法知道客户会如何行动,但可以先明确需要检验的假设。

如果更多来电开始升级,并且客户在前 30 秒内就退出 AI 体验,团队应调查信任、信息披露、语气和开场交互。如果客户尝试执行任务数分钟后才升级,更可能的问题是系统能力或工作流覆盖范围不足。

核心升级数字相同。但产品决策不同。

一组有用的指标配对本身并不能证明原因。它能缩小调查范围,让下一项决策更加明确。

成本与质量需要结合分析

前文介绍的 Klarna 案例说明了成本与服务质量相互作用时,这项原则如何适用。它展示了公司如何在监控权衡影响并从部署中吸取经验的过程中,调整由 AI 驱动的运营模式。

2024 年 2 月,该公司报告称,其 AI 助手在首月处理了 230 万次对话,完成了相当于 700 名全职客服人员的工作量,并取得了与人工客服相当的客户满意度得分。Klarna 估计,该助手将在 2024 年帮助提升 4000 万美元的利润。这些是 Klarna 自行报告的结果,并非独立评估。

2025 年 5 月,Klarna 的首席执行官表示,公司在客户服务中过度强调了降低成本,并介绍了扩大人工支持渠道的计划。这意味着调整自动化服务与人工服务之间的平衡,而非否定 AI 助手或其底层技术。

公开证据说明,评估效率指标时为何还应考虑不同客户和交互的需求。AI 系统的平均表现可能很好,但一些复杂、敏感或特殊案例仍会受益于便捷的人工渠道。

同时监控这种关系的两面,有助于公司判断自动化在何处创造价值、人工支持在何处仍然重要,以及随着新证据出现应如何调整二者的平衡。

AI 产品中其他相互制约的指标配对可能包括:

相互制约的指标配对

有助于揭示的风险

响应准确率 ↔ 响应延迟

系统在技术上准确,却慢得无法满足工作流要求。

任务完成率 ↔ 用户推翻率

AI 工作流完成了任务,但用户反复重新操作。

每次交互成本 ↔ 经评估的输出质量

以牺牲客户或员工体验为代价实现节省。

采用率 ↔ 实现价值所需时间

注册量增长,却没有带来相应的用户价值。

目的并不是让两项指标无限增长,而是在单边优化造成运营问题之前,让权衡清晰可见。

客户的初始状态会改变指标的含义

一家移动游戏公司的玩家支持部署也遇到了类似挑战。该系统处理了大量问题,例如进度丢失、付款争议和账号访问。

由于系统需要大规模运行,效率指标十分重要。但玩家支持并不只是一个运营队列。玩家前来求助时往往已经很沮丧,因为他们的体验在其他环节出了问题。

这种初始状态会改变客户满意度数据的解读方式。即使问题得到正确解决,玩家仍可能因为最初丢失了进度而给出较低的满意度。脱离情境解读该分数,可能会让支持交互为客户旅程早期产生的不满承担责任。

因此,团队需要区分客户的初始情绪与支持体验带来的影响。更有用的问题不是:“玩家满意吗?”而是:“与玩家最初的状态相比,这次交互是否改善了情况?”

只要团队能可靠地衡量两者,这种比较就有助于区分产品引发的不满与支持服务的质量。

衡量方式应随产品变化

AI 产品会变化,但其指标往往保持不变。

在试点阶段,核心问题可能是系统是否足够可靠,值得继续投资:

  • 它能否可靠地完成核心任务?

  • 用户是否足够信任它,愿意继续使用?

  • 在最常见场景之外,它表现如何?

  • 能否识别故障并安全恢复?

这些问题更适合使用以下指标配对:

  • 核心任务成功率 ↔ 边缘案例表现;

  • 自动化率 ↔ 人工推翻率;以及

  • 完成速度 ↔ 用户信心。

一旦产品对运营变得重要,需要回答的问题也会变化:

  • 它能否在不降低质量的情况下扩展?

  • 随着使用增加,其经济效益是否会改善?

  • 采用率增长时,性能是否仍保持稳定?

  • 人工干预是否发生在恰当的环节?

相应的指标配对可能转向:

  • 每次交互成本 ↔ 经评估的输出质量;

  • 采用广度 ↔ 使用深度;以及

  • 自动化率 ↔ 运营风险敞口。

早期指标并不一定有误。它们回答的是早期阶段的重要问题。

风险出现在过渡期间。试点阶段的指标往往会沿用下去,因为团队熟悉其报告方式,而且无人负责决定何时停用。曾经有助于学习的指标,可能逐渐沦为虚荣指标。

因此,指标配对也应有自己的生命周期。团队应围绕明确的决策引入指标配对,审查其是否仍能揭示实质性权衡,并在产品或决策发生变化时将其停用。

监控与决策属于不同层面

AI 系统需要细致的可观测性、警报、质量保证和评估。移除这些信号会增加产品安全运营的难度。但运营监控不同于管理层衡量。

监控帮助团队发现事件、追踪故障并了解系统行为。决策指标帮助产品和业务负责人决定是投资、干预、调整方向,还是接受某项权衡。

组织可以监控数百个技术和运营信号,同时只选出两三组相互制约的指标,为某项具体产品决策提供依据。保持决策层精简,有助于确定优先级。

适当的审查频率取决于产品。新系统或快速变化的系统可能需要每周审查决策,而成熟产品可以按月或按季度审查。原则比具体间隔更重要:应足够频繁地审查指标配对,以便在权衡造成高昂代价或安全风险之前采取行动。

明确指标配对应触发的行动

只有组织就指标恶化后应采取的措施达成共识,指标配对才真正有用。

仅仅为背离设定红线还不够。团队应考虑三种情况:

  • 绝对失效:无论另一项如何,其中一项指标越过不可接受的阈值。

  • 背离:一项指标改善,而与之制衡的指标恶化。

  • 共同恶化:两项指标的表现均在恶化,表明可能存在更广泛的产品或运营问题。

每组指标配对都应具备:

  • 明确指定的负责人;

  • 其支持的明确决策;

  • 商定的阈值或评估标准;

  • 调查路径;以及

  • 一套可行的干预措施。

缺少这些要素,组织就只是在观察产品,而不是管理产品。

下次指标审查时要问的五个问题

在添加新指标之前,先选择一项重要的产品决策,并逐一回答以下问题。写下答案,确保审查结束时就下一步行动达成共识。

1. 我们需要这些指标帮助做出哪项决策?

要具体说明:我们是在决定是否扩大自动化、变更模型,还是改善人工交接?先明确决策,再选择指标。

2. 如果这个数字改善了,哪些方面可能恶化?

确定需要保护的结果,以及能够揭示损害的指标。例如,将每次交互成本与经评估的输出质量配对,以确认成本更低的回答是否仍然有用。

3. 核心数字可能掩盖了什么?

针对相同用户、任务和时间段分析两项指标,再寻找结果较差的群体。还应考虑初始状态:满意度低可能源自支持交互开始前就已存在的不满。

4. 什么情况会促使我们采取行动,由谁负责响应?

设定行动标准:一项指标越过不可接受的界限、一项改善而另一项恶化,或两项同时恶化时,都应采取行动。商定由谁调查、首先检查什么,以及何时反馈结果。

5. 这组指标配对是否仍适合产品的当前阶段?

决定是保留、替换还是停用。试点阶段可能侧重任务可靠性和用户信心;上线服务则可能需要更仔细地审视成本和质量。设定重新审视该选择的日期。

AI 产品衡量不应只描述性能。它还应揭示组织正在做出的权衡,让下一项决策更加明确。

作者

Ale Zacarias、Josie Steer