지표를 추가한다고 반드시 이해도가 높아지는 것은 아니다. 많은 대시보드에는 동일한 기저 행동을 측정하는 여러 지표가 담겨 있다. 비용과 품질, 자체 처리와 고객 정서, 정확도와 지연 시간처럼 서로 견제하는 상호 파괴적 지표 쌍을 구성하면 진단력이 높아진다.
적절한 지표 쌍은 AI 제품이 파일럿에서 프로덕션으로 전환됨에 따라 달라진다. 각 단계에서 팀이 내려야 하는 결정에 맞춰 측정해야 한다.
운영 모니터링과 전략적 측정은 목적이 서로 다르다. 팀은 수백 개의 시스템 신호를 추적하면서도 제품 결정에는 몇 개의 지표 쌍만 활용할 수 있다.
대표 지표는 그럴듯한 결과를 보여 주면서도 정작 중요한 제품 결정을 내리는 데 필요한 답은 주지 못할 수 있다.
Klarna의 AI 어시스턴트는 더 높은 처리량, 더 낮은 비용, 인간 에이전트와 비슷한 고객 만족도 점수를 달성한 것으로 대외적으로 알려졌다. 이듬해 이 회사는 인간 상담 지원에 대한 접근성을 확대하기로 했으며, 최고경영자는 비용 절감에 지나치게 중점을 두었다고 인정했다.
이는 AI 어시스턴트나 그 기반 기술 자체를 거부한 것은 아니었습니다. 회사가 제품을 운영하며 얻은 경험을 바탕으로 자동화와 사람을 통한 서비스 간의 균형을 조정한 것이었습니다. 자동화가 대량으로 발생하는 비교적 단순한 문의를 더 많이 처리하게 되면서 Klarna에는 복잡하고 민감한 사례를 처리할 역량을 갖춘 상담원이 필요하게 되었습니다.
처음부터 제품이 달성해야 할 목표를 정의했더라도, AI 제품을 만드는 대부분의 조직은 결국 같은 질문을 마주한다. 실제로 잘 작동하고 있는가?
답이 명확하지 않으면 흔히 지표부터 더 추가하려 한다. 3개가 10개로, 다시 10개가 30개로 늘어난다. 대시보드는 풍부해지지만 팀의 이해도는 높아지지 않을 수 있다.
문제는 개별 측정값의 품질이 아니라 측정값 간의 관계에 있을 때가 많다. 고객 만족도, 순추천고객지수(NPS), 리뷰, ‘좋아요’ 비율은 모두 유용한 신호지만 전반적인 고객 정서의 비슷한 변화를 반영할 수 있다. 이들이 함께 움직이면 무언가 일어났다는 사실은 확인할 수 있지만 그 이유까지 설명하지는 못한다.
따라서 AI 팀은 서로 같은 방향을 가리키는 지표를 넘어, 상충하는 결과를 드러내는 측정값을 찾아야 한다. 이러한 상호 파괴적 지표 쌍은 제품 성과 이면에 존재하는 상충 관계의 영향을 파악하고 모니터링할 수 있게 해 더 나은 의사결정을 내리는 데 도움이 된다.
출시 전 한 배포 프로젝트에서 공동 팀은 인바운드 고객 지원 전화를 위한 실시간 AI 음성 에이전트를 개발하고 있었다. 가장 어려운 질문 중 하나는 모델 선택이나 오케스트레이션에 관한 것이 아니었다. 고객이 대규모로 사용하기 시작한 뒤 제품이 제대로 작동하는지 조직이 어떻게 판단할 것인지가 문제였다.
초기 프레임워크에는 다음 세 가지 측정값이 사용되었다.
자체 처리율: AI가 상담원에게 연결하지 않고 고객의 문제를 해결하는 비율.
상담원 전환율: 통화가 인간 에이전트에게 연결되는 비율.
최종 해결률: 고객의 문제가 최종적으로 해결되는 비율.
각 측정값은 타당했다. 하지만 이들을 함께 봐도 당연히 제기되는 한 가지 질문에는 답할 수 없었다. 상담원 전환이 늘었다면 그것은 무엇을 의미하는가?
팀은 상담원 전환을 8가지 하위 유형으로 나눴다. 이어서 포기율, 여정 및 소요 시간 측정값, 언어 이해 점수, 문의 유형별 최종 해결률을 추가했다. 결국 프레임워크에는 6개 범주의 지표 31개가 포함되었다.
상담원 전환을 자세히 설명할 수는 있었지만 그 원인을 신뢰성 있게 진단하지는 못했다. 대부분의 지표가 같은 현상을 조금씩 다른 방식으로 측정한 것이었기 때문에 서로 다른 원인에 대한 가설을 검증하기보다는 비슷한 움직임을 보였다.
대시보드는 진단 도구가 아니라 관찰 도구가 되어 버렸다.
팀에 필요했던 것은 또 다른 세분화 단계가 아니었다. 서로를 견제하는 지표가 필요했다.
이를 상호 파괴적 지표 쌍이라고 한다. 한쪽만 개선하면 다른 쪽이 나타내는 결과가 악화될 수 있는 두 측정값이다. 이 명칭은 바람직한 상태가 아니라 한쪽만 최적화할 때 발생하는 실패 양상을 뜻한다.
두 지표가 모두 양호한 수준을 유지한다면 제품이 지속 가능한 방식으로 운영되고 있다고 볼 수 있다. 두 지표의 추세가 서로 달라지면 어떤 지표가 어느 방향으로 변하는지를 통해 무엇을 조사해야 할지 판단할 수 있다.
기존 측정 방식 | 상호 파괴적 지표 쌍 | 지표 쌍으로 파악할 수 있는 점 |
|---|---|---|
상담원 전환율을 8가지 하위 유형으로 구분 | 상담원 전환율 ↔ 전환까지 걸린 시간 | 즉시 전환되면 신뢰나 안내 방식의 문제일 수 있고, 나중에 전환되면 시스템이 작업을 완료하지 못하는 문제일 수 있다. |
자체 처리율과 최종 해결률을 별도로 보고 | 자체 처리율 ↔ 고객 정서 | 자체 처리가 만족스러운 해결을 의미하는지, 고객이 시도를 포기했음을 의미하는지 파악할 수 있다. |
의도 유형별 최종 해결률 | 최종 해결률 ↔ 대화 길이 | 성공적인 해결이 효율적으로 이루어지는지, 지칠 만큼 긴 상호작용이 필요한지 파악할 수 있다. |
이 관계가 어떻게 드러나고 그 통찰을 어떻게 활용할지 더 깊이 살펴보기 위해 상담원 전환율과 전환까지 걸린 시간을 생각해 보자. 실제 통화가 시작되기 전에는 고객의 행동을 알 수 없지만, 검증해야 할 가설은 정의할 수 있다.
상담원에게 전환되는 통화가 늘고 고객이 처음 30초 안에 AI 경험을 이탈한다면 신뢰, 고지 방식, 어조, 초기 상호작용을 조사해야 한다. 고객이 몇 분 동안 작업을 시도한 뒤 상담원 전환을 요청한다면 기능이나 워크플로 지원 범위가 문제일 가능성이 더 크다.
겉으로 드러나는 상담원 전환율은 같아도, 내려야 할 제품 의사결정은 달라진다.
유용한 지표 쌍만으로 원인이 입증되는 것은 아니다. 대신 조사 범위를 좁히고 다음에 어떤 의사결정을 내려야 할지 더 명확하게 해 준다.
앞서 소개한 Klarna 사례는 비용과 서비스 품질 사이에 상충 관계가 있을 때 이 원칙이 어떻게 적용되는지 보여 준다. 또한 기업이 상충 관계의 영향을 모니터링하고 실제 운영을 통해 교훈을 얻으면서 AI 기반 운영 모델을 어떻게 발전시킬 수 있는지 보여 준다.
2024년 2월, Klarna는 AI 어시스턴트가 출시 첫 달에 230만 건의 대화를 처리하고 정규직 에이전트 700명에 해당하는 업무를 수행했으며 인간 에이전트와 비슷한 고객 만족도 점수를 달성했다고 발표했다. Klarna는 이 어시스턴트가 2024년에 4,000만 달러의 이익 개선에 기여할 것으로 추산했다. 이는 독립적인 평가가 아니라 Klarna가 자체적으로 발표한 결과였다.
2025년 5월, Klarna의 최고경영자는 고객 서비스에서 비용 절감을 지나치게 강조했다고 밝히며 인간 상담 지원에 대한 접근성을 확대할 계획을 설명했다. 이는 AI 어시스턴트나 그 기반 기술을 거부한 것이 아니라 자동화 서비스와 인간 서비스 간 균형을 조정한 것이었다.
공개된 자료는 효율성 지표를 다양한 고객과 상호작용별 요구 사항과 함께 고려해야 하는 이유를 보여 준다. AI 시스템이 평균적으로 좋은 성과를 내더라도 복잡하거나 민감하거나 이례적인 일부 사례에서는 쉽게 이용할 수 있는 인간 상담 채널이 더 유용할 수 있다.
이 관계의 양쪽을 모니터링하면 자동화가 가치를 창출하는 지점, 인간 지원이 여전히 중요한 지점, 새로운 근거가 나올 때마다 둘 사이의 균형을 어떻게 조정할지 판단할 수 있다.
AI 제품 전반에서 활용할 수 있는 다른 상호 파괴적 지표 쌍은 다음과 같다.
상호 파괴적 지표 쌍 | 드러낼 수 있는 위험 |
|---|---|
응답 정확도 ↔ 응답 지연 시간 | 기술적으로는 정확하지만 워크플로에서 사용하기에는 너무 느린 시스템. |
작업 완료율 ↔ 사용자 재수행률 | 작업을 완료하지만 사용자가 반복해서 다시 수행해야 하는 AI 워크플로. |
상호작용당 비용 ↔ 평가된 출력 품질 | 고객 또는 직원 경험을 저하시켜 달성한 비용 절감. |
도입률 ↔ 가치 실현 시간 | 사용자 가치의 증가 없이 가입자 수만 늘어나는 현상. |
목적은 두 측정값을 끝없이 높이는 것이 아니다. 한쪽만 최적화해 운영 문제가 발생하기 전에 두 지표 사이의 상충 관계를 파악할 수 있도록 하는 것이다.
모바일 게임 회사에 플레이어 지원 시스템을 배포하는 과정에서도 이와 관련된 문제가 나타났다. 시스템은 진행 상황 손실, 결제 분쟁, 계정 접근과 같은 문의량이 많은 문제를 처리했다.
시스템이 대규모로 운영되었으므로 효율성 지표가 중요했다. 하지만 플레이어 지원은 단순한 운영 대기열이 아니다. 플레이어는 이미 다른 경험에서 문제가 발생해 불만이 쌓인 상태로 문의하는 경우가 많다.
이러한 시작 상황에 따라 고객 만족도 데이터를 해석하는 방식도 달라져야 한다. 문제가 제대로 해결되었더라도 애초에 진행 상황을 잃은 플레이어는 낮은 만족도를 표시할 수 있다. 맥락 없이 이 점수를 해석하면 고객 여정의 앞 단계에서 생긴 불만의 책임을 지원 상호작용에 돌릴 수 있다.
따라서 팀은 고객이 처음 느꼈던 감정과 지원 경험이 미친 영향을 구분해야 했다. 더 유용한 질문은 “플레이어가 만족했는가?”가 아니라 “상호작용을 통해 플레이어의 처음 상황이 개선되었는가?”였다.
두 요소를 신뢰성 있게 측정할 방법이 있다면 이 비교를 통해 제품에 대한 불만과 지원 품질을 구분할 수 있다.
AI 제품은 변하지만 지표는 고정된 채로 남는 경우가 많다.
파일럿 단계의 핵심 질문은 시스템이 지속적인 투자를 정당화할 만큼 신뢰할 수 있는지일 수 있다.
핵심 작업을 안정적으로 완료하는가?
사용자가 계속 이용할 만큼 신뢰하는가?
가장 일반적인 시나리오를 벗어나면 어떻게 작동하는가?
실패를 식별하고 안전하게 복구할 수 있는가?
이러한 질문에는 다음과 같은 지표 쌍이 적합하다.
핵심 작업 성공률 ↔ 예외 사례 성능;
자동화율 ↔ 인간 개입률;
완료 속도 ↔ 사용자 신뢰도.
제품이 운영상 중요해지면 질문도 달라진다.
품질 저하 없이 확장할 수 있는가?
사용량이 늘어날수록 비용 효율성이 개선되는가?
도입이 확대되어도 성능이 안정적으로 유지되는가?
인간의 개입이 적절한 지점에서 이루어지는가?
이에 따라 적절한 지표 쌍은 다음과 같이 바뀔 수 있다.
상호작용당 비용 ↔ 평가된 출력 품질;
도입 범위 ↔ 활용 수준;
자동화율 ↔ 운영 위험 노출도.
초기 지표가 반드시 잘못된 것은 아니다. 그 지표들은 이전 단계에서 중요했던 질문에 답한다.
위험은 전환 과정에서 발생한다. 팀이 보고 방법에 익숙하고 폐기를 결정할 책임자가 없기 때문에 파일럿 지표가 계속 사용되는 경우가 많다. 한때 학습에 도움이 되었던 측정값도 점차 실질적인 의사결정에는 도움이 되지 않고 겉으로 보여 주기 위한 지표가 될 수 있다.
따라서 지표 쌍에도 수명 주기가 있어야 한다. 특정 결정을 위해 지표 쌍을 도입하고, 여전히 중요한 상충 관계를 드러내는지 검토하며, 제품이나 결정이 바뀌면 폐기해야 한다.
AI 시스템에는 세부적인 관측 가능성, 경보, 품질 보증, 평가가 필요하다. 이러한 신호를 제거하면 제품을 안전하게 운영하기가 더 어려워진다. 하지만 운영 모니터링과 경영진을 위한 측정은 서로 다르다.
모니터링은 팀이 사고를 감지하고 실패를 추적하며 시스템 행동을 이해하도록 돕는다. 의사결정 지표는 제품 및 비즈니스 리더가 투자, 개입, 방향 전환 또는 상충 관계 수용 여부를 판단하도록 돕는다.
조직은 수백 개의 기술·운영 신호를 모니터링하면서도 특정 제품 결정에는 상호 파괴적 지표 쌍 두세 개만 핵심으로 다룰 수 있다. 의사결정에 사용하는 핵심 지표를 이처럼 소수로 유지하면 우선순위를 정하기가 쉬워진다.
적절한 검토 주기는 제품에 따라 다르다. 새롭거나 빠르게 변하는 시스템은 매주 의사결정을 검토해야 할 수 있지만, 성숙한 제품은 매월 또는 분기별 검토로 충분할 수 있다. 주기보다 원칙이 중요하다. 상충 관계로 인해 큰 비용이나 안전 문제가 발생하기 전에 조치할 수 있을 만큼 자주 지표 쌍을 검토해야 한다.
지표 쌍이 악화될 때 취할 조치에 조직이 합의해야 지표 쌍이 비로소 유용해진다.
이를 위해서는 두 지표가 어느 정도까지 엇갈리면 문제가 되는지 기준선을 정하는 것만으로는 부족하다. 팀은 다음 세 가지 조건을 고려해야 한다.
절대적 실패: 다른 측정값과 관계없이 한 측정값이 허용 불가능한 임계값을 넘는다.
엇갈림: 한 측정값은 개선되는 반면 이를 견제하는 측정값은 악화된다.
동반 악화: 양쪽 모두 하락하여 더 광범위한 제품 또는 운영 문제를 시사한다.
각 지표 쌍에는 다음 요소가 있어야 한다.
지정된 담당자;
지원할 명확한 의사결정;
합의된 임계값 또는 평가 기준;
조사 절차;
실행 가능한 개입 방안.
이러한 요소가 없다면 조직은 제품을 관리하는 것이 아니라 관찰하는 데 그친다.
측정값을 하나 더 추가하기 전에 중요한 제품 결정 하나를 선택하고 다음 질문을 검토하라. 검토가 합의된 다음 단계로 이어지도록 답을 기록하라.
1. 이 지표로 어떤 결정을 내려야 하는가?
구체적으로 정하라. 자동화를 확대할지, 모델을 변경할지, 인간 상담원 연결을 개선할지 결정하려는 것인가? 측정값을 선택하기 전에 결정을 먼저 명시하라.
2. 이 수치가 개선되면 무엇이 악화될 수 있는가?
한 지표를 개선할 때 악화되어서는 안 되는 결과가 무엇인지 파악하고, 이러한 악화를 포착할 수 있는 측정값을 정하라. 예를 들어 상호작용당 비용과 평가된 출력 품질을 함께 살펴, 더 저렴한 답변이 여전히 유용한지 확인하라.
3. 대표 수치만으로는 무엇을 놓칠 수 있는가?
동일한 사용자, 작업, 기간을 기준으로 두 측정값을 함께 읽고 더 나쁜 결과를 겪는 집단을 찾아라. 시작 상황도 고려하라. 만족도가 낮은 이유는 지원이 시작되기 전부터 고객이 불만을 느끼고 있었기 때문일 수 있다.
4. 어떤 상황에서 조치하며, 대응 책임자는 누구인가?
한 측정값이 허용 불가능한 한계를 넘거나, 한쪽은 개선되고 다른 쪽은 악화되거나, 양쪽 모두 악화될 때의 조치 기준을 정하라. 누가 조사하고, 무엇을 먼저 확인하며, 언제 결과를 보고할지 합의하라.
5. 이 지표 쌍이 여전히 제품의 현재 단계에 적합한가?
유지할지, 교체할지, 폐기할지 결정하라. 파일럿에서는 작업 신뢰성과 사용자 신뢰에 집중할 수 있지만, 실제 서비스에서는 비용과 품질을 더 면밀히 살펴야 할 수 있다. 이 선택을 다시 검토할 날짜를 정하라.
AI 제품 측정은 성과를 설명하는 데 그쳐서는 안 된다. 조직이 감수하는 상충 관계를 드러내고 다음 결정을 더 명확하게 만들어야 한다.