指標を増やしても、必ずしも理解が深まるとは限りません。多くのダッシュボードには、同じ根本的な行動を測る複数の指標が含まれています。コストと品質、自己完結率と顧客感情、精度とレイテンシーなど、相反する指標をペアにすると、原因の診断に役立ちます。
適切なペアは、AI 製品がパイロットから本番運用へ移行するにつれて変わります。測定は、各段階でチームが下すべき意思決定に沿って行う必要があります。
運用監視と戦略的な測定では目的が異なります。チームは数百ものシステムシグナルを追跡しつつ、製品の意思決定には数組のペアだけを使うことがあります。
主要指標だけでも説得力のある説明はできますが、重要な製品判断が未解決のまま残ることがあります。
Klarna の AI アシスタントについては、処理件数の増加、コスト削減、人間の担当者に匹敵する顧客満足度スコアが公表されていました。翌年、同社は人によるサポートを利用しやすくする方針を決め、最高経営責任者もコスト削減を重視しすぎたと認めました。
これは、AI アシスタントやその基盤技術を否定するものではありませんでした。製品運用から得た知見を踏まえ、自動化と人によるサービスのバランスを調整したのです。大量に寄せられる比較的単純な問い合わせへの対応が自動化されるにつれ、Klarna が必要としていたのは、複雑で慎重な対応が求められるケースを扱う能力を備えた担当者でした。
AI 製品を構築する多くの組織は、製品が達成すべき目標を当初に定めていても、いずれ同じ問いに直面します。その製品は、実際に期待どおりの成果を上げているのでしょうか。
答えが明確でないと、指標を増やそうとしがちです。3 個が 10 個になり、10 個が 30 個になります。ダッシュボードは充実しても、チームの理解が深まるとは限りません。
問題は個々の測定値の品質ではなく、測定値同士の関係にある場合があります。顧客満足度、ネットプロモータースコア、レビュー、高評価率はいずれも有用なシグナルですが、全体的な顧客感情の同じ変化を反映している可能性があります。これらが連動して変化すると、何かが起きたことは確認できても、その理由までは説明できない場合があります。
そのため、AI チームは同じ傾向を示す指標だけを見るのではなく、両立が難しい成果の関係を明らかにする指標を特定する必要があります。こうした相反する指標ペアは、製品のパフォーマンスの背後にあるトレードオフの影響を可視化し、継続的な監視と、より良い意思決定に役立ちます。
あるリリース前の導入案件では、合同チームが受電型カスタマーサポート向けのリアルタイム AI 音声エージェントを開発していました。特に難しい問題の一つは、モデルの選択やオーケストレーションではありませんでした。顧客が大規模に利用し始めた後、製品が機能しているかを組織がどう判断するかでした。
当初のフレームワークでは、次の 3 つの指標を使用しました。
自己完結率:AI が担当者へ通話を転送せずに問い合わせを解決する割合
エスカレーション率:通話が人間の担当者へ転送される割合
解決率:顧客の問題が最終的に解決される割合
どの指標にも妥当性がありました。しかし、これらを併用しても、「エスカレーションが増えた場合、そこから何が分かるのか」という明白な問いには答えられませんでした。
チームはエスカレーションを 8 つのサブタイプに分解しました。さらに、離脱、ジャーニー、所要時間の指標、言語理解スコア、問い合わせタイプ別の解決率を追加しました。最終的に、フレームワークには 6 カテゴリ、31 個の指標が含まれました。
エスカレーションを詳しく説明できるようになっても、その原因を確実に診断することはできませんでした。指標の大半は同じ行動を少しずつ異なる形で測っていたため、連動して変化するだけで、原因についての異なる仮説を検証することには役立ちませんでした。
ダッシュボードは診断ではなく、観察のためのものになっていました。
チームに必要だったのは、さらに細かく分解することではありませんでした。必要だったのは、互いを制約する指標です。
これを相反する指標ペアと呼びます。一方だけを改善すると、もう一方が表す結果を損なう可能性がある 2 つの指標です。この名称が表すのは、一方だけを最適化した場合の失敗パターンであり、目指すべき状態ではありません。
両方が健全であれば、製品は持続可能な形で稼働している可能性があります。両者が乖離した場合、その方向から、チームは調査すべき箇所を判断できます。
従来の指標 | 相反する指標ペア | ペアから分かる可能性があること |
|---|---|---|
8 つのサブタイプに分けたエスカレーション率 | エスカレーション率 ↔ エスカレーションまでの時間 | 即時のエスカレーションは信頼や説明方法の問題を、遅れて発生する場合はシステムがタスクを完了できないことを示している可能性があります。 |
個別に報告される自己完結率と解決率 | 自己完結率 ↔ 顧客感情 | 自己完結が、顧客の満足する形で問題が解決したことを意味するのか、それとも顧客が解決を諦めたことを意味するのか |
意図タイプ別の解決率 | 解決率 ↔ 会話の深さ | 効率的に解決できたのか、それとも疲弊するほどのやり取りが必要だったのか |
これがどのように明らかになり、得られた知見をどう活用するかを詳しく見るため、エスカレーション率とエスカレーションまでの時間を考えてみます。実際の通話が始まるまで顧客の行動は分かりませんが、検証すべき仮説は定義できます。
エスカレーションされる通話が増え、顧客が最初の 30 秒以内に AI とのやり取りを離れた場合は、信頼、情報開示、口調、冒頭の応対を調査する必要があります。顧客がタスクを数分間試みた後にエスカレーションする場合は、機能やワークフローの対応範囲に問題がある可能性が高まります。
エスカレーションの主要な数値は同じでも、製品について下すべき判断は異なります。
有用なペアだけで原因を証明できるわけではありません。調査範囲を絞り、次の意思決定を明確にします。
先ほどの Klarna の事例は、コストとサービス品質が相互に影響する場合に、この原則がどう当てはまるかを示しています。企業がトレードオフの影響を監視し、導入から学ぶ中で、AI を活用した運用モデルがどう進化し得るかを示す事例です。
同社は2024年2月、AI アシスタントが最初の1か月で230万件の会話に対応し、フルタイムの担当者700人分に相当する業務を行い、人間の担当者に匹敵する顧客満足度スコアを達成したと発表しました。Klarna は、このアシスタントが2024年中に4,000万ドルの利益改善に寄与すると推定しました。これは独立した評価ではなく、Klarna 自身が報告した結果です。
2025年5月、Klarna の最高経営責任者は、カスタマーサービスでコスト削減を重視しすぎたと述べ、人によるサポートを利用しやすくする計画を明らかにしました。これは、AI アシスタントやその基盤技術を否定したのではなく、自動化されたサービスと人によるサービスのバランスを調整したものです。
公開情報は、効率性の指標だけでなく、顧客や応対内容によって異なるニーズも併せて検討すべき理由を示しています。AI システムが平均的には高い性能を発揮していても、複雑なケース、慎重な対応が必要なケース、通常とは異なるケースでは、利用しやすい有人窓口が役立つことがあります。
両方を監視することで、自動化が価値を生む領域、人によるサポートが引き続き重要な領域、新たな根拠に応じたバランスの調整方法を判断できます。
AI 製品におけるその他の相反する指標ペアには、次のようなものがあります。
相反する指標ペア | 明らかにできるリスク |
|---|---|
回答精度 ↔ 応答レイテンシー | 技術的には正確でも、ワークフローで使うには遅すぎるシステム |
タスク完了率 ↔ ユーザーによるやり直し率 | タスクを完了しても、ユーザーが繰り返しやり直す AI ワークフロー |
やり取り1件当たりのコスト ↔ 出力品質の評価 | 顧客や従業員の体験を損なうことで実現したコスト削減 |
導入率 ↔ 価値を得るまでの時間 | ユーザー価値を伴わない登録者数の増加 |
目的は、両方の指標を際限なく高めることではありません。一方だけの最適化が運用上の問題を引き起こす前に、トレードオフを可視化することです。
モバイルゲーム会社のプレイヤーサポートにシステムを導入した際にも、関連する課題が生じました。このシステムは、ゲームの進行状況の消失、支払いに関する異議申し立て、アカウントへのアクセスなど、多数寄せられる問題に対応していました。
システムが大規模に稼働していたため、効率性の指標は重要でした。しかし、プレイヤーサポートは、問い合わせを順番に処理するだけの業務ではありません。プレイヤーは、サポートを利用する前にすでに別の場面で問題に遭遇し、不満を抱えた状態で問い合わせることがよくあります。
問い合わせ前の状況によって、顧客満足度データの解釈は変わります。問題が適切に解決されても、ゲームの進行状況を失ったこと自体への不満から、プレイヤーが満足度を低く評価する場合があります。こうした背景を考慮せずにスコアを読むと、カスタマージャーニーのそれ以前の段階で生じた不満によって、サポート対応を不当に低く評価してしまう可能性があります。
そのためチームは、問い合わせ前に顧客が抱いていた感情と、サポート体験がもたらした影響を区別する必要がありました。より有用な問いは、「プレイヤーは満足したか?」ではなく、「サポートでのやり取りによって、問い合わせ前より状況が改善したか?」でした。
両方を確実に測定できれば、この比較によって、製品への不満とサポート品質を切り分けやすくなります。
AI 製品は変化しても、その指標は固定されたままになりがちです。
パイロットでは、投資を継続するに足る信頼性がシステムにあるかどうかが、中心的な問いになる場合があります。
中核タスクを確実に完了できますか?
ユーザーは、利用を続けようと思えるほどシステムを信頼していますか?
よくあるシナリオ以外では、どのように動作しますか?
障害を特定し、安全に復旧できますか?
こうした問いには、次のようなペアが適しています。
中核タスクの成功率 ↔ エッジケースでの性能
自動化率 ↔ 人による介入率
完了速度 ↔ ユーザーの安心感
製品が運用上重要になると、問いは次のように変わります。
品質を落とさずに拡張できますか?
利用が増えるにつれて経済性は向上しますか?
導入が広がってもパフォーマンスは安定していますか?
人による介入は適切な箇所で行われていますか?
対応するペアは、次のようなものへ移行する可能性があります。
やり取り1件当たりのコスト ↔ 出力品質の評価
導入の広がり ↔ 利用の深さ
自動化率 ↔ 運用リスクにさらされる度合い
初期の指標が必ずしも間違っているわけではありません。それらは、以前の段階で重要だった問いに答えるものです。
リスクが生じるのは移行時です。パイロット時の指標は、チームが報告方法を把握しており、廃止の判断を担う責任者もいないため、そのまま残りがちです。かつて学習に役立った測定値が、徐々に見栄えだけの指標になることがあります。
したがって、指標ペアにもライフサイクルが必要です。明確な意思決定のために導入し、重要なトレードオフを今も明らかにできるか見直し、製品や意思決定が変わったら廃止する必要があります。
AI システムには、詳細な可観測性、アラート、品質保証、評価が必要です。こうしたシグナルをなくすと、製品を安全に運用することが難しくなります。ただし、運用監視と経営判断のための測定は同じではありません。
監視は、インシデントの検出、障害の追跡、システム動作の把握に役立ちます。意思決定指標は、製品や事業の責任者が、投資、介入、方向転換、トレードオフの受容を判断するために役立ちます。
組織は数百もの技術・運用シグナルを監視しながら、特定の製品判断で重視する相反する指標ペアを 2〜3 組だけに絞ることができます。この意思決定レイヤーを小さく保つことで、優先順位を付けやすくなります。
適切な見直し頻度は製品によって異なります。新しいシステムや急速に変化するシステムでは毎週の意思決定レビューが必要な一方、成熟した製品では毎月または四半期ごとでもよい場合があります。頻度よりも原則が重要です。トレードオフが高コストまたは危険になる前に対処できる頻度で、ペアを見直します。
指標ペアが悪化した場合の対応について組織内で合意して初めて、そのペアは有用になります。
そのためには、乖離の危険水準を定めるだけでは不十分です。チームは次の 3 つの条件を検討する必要があります。
絶対的な失敗:もう一方に関係なく、一方の指標が許容できないしきい値を超える
乖離:一方の指標が改善する一方で、対となる指標が悪化する
同時悪化:両方の指標が悪化し、製品または運用上のより広範な問題が示唆される
各ペアに必要な要素は次のとおりです。
指名された責任者
支援する意思決定の明確な定義
合意済みのしきい値または評価基準
調査手順
実施可能な介入策
これらの要素がなければ、組織は製品を管理せず、観察しているにすぎません。
別の指標を追加する前に、重要な製品判断を一つ選び、次の質問を検討してください。レビュー後の次のステップについて合意できるよう、回答を書き留めてください。
1. これらの指標を使って、どの意思決定を行う必要がありますか?
具体的に考えます。自動化の拡大、モデルの変更、人への引き継ぎの改善のどれを判断するのでしょうか。指標を選ぶ前に、意思決定を明確にします。
2. この数値が改善すると、何が悪化する可能性がありますか?
維持すべき成果と、それが損なわれた場合に分かる指標を特定します。例えば、やり取り1件当たりのコストと出力品質の評価を組み合わせ、コストを下げても回答の有用性が保たれているかを確認します。
3. 主要な数値は何を隠している可能性がありますか?
同じユーザー、タスク、期間について両方の指標を読み取り、結果が悪化しているグループを探します。開始時の状況も考慮します。満足度の低さは、サポートを利用する前からの不満を反映している場合があります。
4. どのような場合に対応し、その責任は誰が負いますか?
一方が許容限度を超えた場合、一方が改善してもう一方が悪化した場合、または両方が悪化した場合の対応基準を設定します。調査担当者、最初に確認する内容、報告期限について合意します。
5. このペアは、今も製品の現在の段階に適していますか?
維持、置換、廃止のいずれかを判断します。パイロットではタスクの信頼性とユーザーの安心感を重視し、本番サービスではコストと品質をより厳密に検討する必要があります。選択を見直す日を設定します。
AI 製品の測定は、パフォーマンスを説明するだけでは不十分です。組織が選択しているトレードオフを明らかにし、次に下すべき判断を明確にする必要があります。