Thêm chỉ số không nhất thiết giúp nâng cao hiểu biết. Nhiều bảng điều khiển chứa nhiều thước đo cho cùng một hành vi cơ bản. Các chỉ số có khả năng chẩn đoán tốt hơn khi được ghép thành những cặp triệt tiêu lẫn nhau: chi phí với chất lượng, tỷ lệ tự xử lý với cảm nhận khách hàng, hoặc độ chính xác với độ trễ.
Các cặp phù hợp sẽ thay đổi khi sản phẩm AI chuyển từ giai đoạn thí điểm sang vận hành thực tế. Việc đo lường nên bám sát những quyết định mà nhóm cần đưa ra ở từng giai đoạn.
Giám sát vận hành và đo lường chiến lược phục vụ những mục đích khác nhau. Các nhóm có thể theo dõi hàng trăm tín hiệu hệ thống nhưng chỉ dùng một vài cặp để định hướng quyết định về sản phẩm.
Các chỉ số nổi bật có thể tạo nên một câu chuyện thuyết phục nhưng vẫn để ngỏ một quyết định quan trọng về sản phẩm.
Trợ lý AI của Klarna từng được công khai gắn với thông lượng cao hơn, chi phí thấp hơn và điểm hài lòng của khách hàng tương đương nhân viên hỗ trợ. Năm sau, công ty quyết định mở rộng khả năng tiếp cận dịch vụ hỗ trợ của con người; giám đốc điều hành thừa nhận rằng họ đã quá chú trọng việc cắt giảm chi phí.
Đây không phải là sự bác bỏ trợ lý AI hay công nghệ nền tảng của nó. Đó là sự điều chỉnh cán cân giữa tự động hóa và dịch vụ do con người cung cấp khi công ty rút kinh nghiệm từ quá trình vận hành sản phẩm. Khi tự động hóa đảm nhận nhiều hơn các truy vấn đơn giản, có số lượng Cao lớn, các nhân viên hỗ trợ mà Klarna cần là những người có đủ năng lực xử lý các trường hợp phức tạp, nhạy cảm.
Sau khi xác định ngay từ đầu sản phẩm cần đạt được điều gì, hầu hết tổ chức xây dựng sản phẩm AI cuối cùng đều phải đối mặt với cùng một câu hỏi: sản phẩm có thực sự hiệu quả không?
Nếu câu trả lời chưa rõ, phản ứng thường thấy là bổ sung thêm chỉ số. Ba chỉ số thành 10, rồi 10 thành 30. Bảng điều khiển ngày càng phong phú, nhưng hiểu biết của nhóm có thể không tăng lên.
Vấn đề không phải lúc nào cũng nằm ở chất lượng của từng thước đo, mà ở mối quan hệ giữa các thước đo đó. Mức độ hài lòng của khách hàng, Net Promoter Score, đánh giá và tỷ lệ nhấn nút thích đều có thể cung cấp tín hiệu hữu ích, nhưng tất cả có thể phản ánh những thay đổi tương tự trong cảm nhận chung. Khi cùng biến động, các chỉ số này xác nhận rằng điều gì đó đã xảy ra nhưng không nhất thiết giải thích được nguyên nhân.
Vì vậy, các nhóm AI nên nhìn xa hơn những chỉ số đồng thuận với nhau và xác định các thước đo làm lộ rõ những kết quả đối nghịch. Những cặp triệt tiêu lẫn nhau này giúp bộc lộ và theo dõi tác động của các đánh đổi đằng sau hiệu suất sản phẩm, từ đó hỗ trợ ra quyết định tốt hơn.
Trong một dự án triển khai trước khi ra mắt, nhóm phối hợp đang phát triển một tác nhân thoại AI thời gian thực cho các cuộc gọi hỗ trợ khách hàng đến. Một trong những câu hỏi khó nhất không liên quan đến việc chọn mô hình hay điều phối. Đó là làm sao tổ chức biết sản phẩm có hiệu quả hay không khi khách hàng bắt đầu sử dụng ở quy mô lớn.
Khung ban đầu sử dụng ba thước đo:
Tỷ lệ tự xử lý: tần suất AI giải quyết cuộc gọi mà không chuyển cho nhân viên.
Tỷ lệ chuyển cấp: tần suất cuộc gọi được chuyển cho nhân viên hỗ trợ.
Tỷ lệ giải quyết thành công: tần suất vấn đề của khách hàng cuối cùng được giải quyết.
Mỗi thước đo đều hợp lý. Tuy nhiên, khi kết hợp, ba thước đo này không thể trả lời một câu hỏi hiển nhiên: nếu tỷ lệ chuyển cấp tăng, điều đó cho chúng ta biết gì?
Nhóm chia hoạt động chuyển cấp thành tám loại phụ. Sau đó, nhóm bổ sung các thước đo về từ bỏ, hành trình và thời gian, điểm hiểu ngôn ngữ, cùng tỷ lệ giải quyết thành công theo loại truy vấn. Cuối cùng, khung này gồm 31 chỉ số thuộc sáu nhóm.
Khung có thể mô tả chi tiết hoạt động chuyển cấp nhưng vẫn không thể chẩn đoán nguyên nhân một cách đáng tin cậy. Hầu hết chỉ số là những biến thể của cùng một hành vi, nên tất cả biến động cùng nhau thay vì kiểm chứng các cách giải thích đối nghịch.
Bảng điều khiển đã trở thành công cụ quan sát thay vì chẩn đoán.
Điều nhóm cần không phải là thêm một lớp phân tách nữa. Nhóm cần những chỉ số kiềm chế lẫn nhau.
Chúng tôi gọi đây là các cặp triệt tiêu lẫn nhau: hai thước đo mà việc cải thiện riêng một thước đo có thể làm tổn hại kết quả do thước đo kia đại diện. Tên gọi này mô tả kiểu thất bại do tối ưu hóa một chiều gây ra, chứ không phải trạng thái mong muốn.
Khi cả hai phía đều duy trì trạng thái tốt, sản phẩm có thể đang vận hành bền vững. Khi hai phía phân kỳ, hướng phân kỳ sẽ giúp nhóm quyết định cần điều tra ở đâu.
Những gì chúng tôi đã có | Cặp triệt tiêu lẫn nhau | Điều cặp chỉ số có thể tiết lộ |
|---|---|---|
Tỷ lệ chuyển cấp được chia thành tám loại phụ | Tỷ lệ chuyển cấp ↔ thời gian đến khi chuyển cấp | Chuyển cấp ngay lập tức có thể cho thấy vấn đề về niềm tin hoặc cách định hướng; chuyển cấp muộn hơn có thể cho thấy hệ thống không thể hoàn thành tác vụ. |
Tỷ lệ tự xử lý và tỷ lệ giải quyết thành công được báo cáo riêng | Tỷ lệ tự xử lý ↔ cảm nhận của khách hàng | Liệu việc tự xử lý có nghĩa là vấn đề được giải quyết thỏa đáng hay khách hàng đã từ bỏ. |
Tỷ lệ giải quyết thành công theo loại ý định | Tỷ lệ giải quyết thành công ↔ độ sâu hội thoại | Liệu việc giải quyết thành công có hiệu quả hay đòi hỏi một cuộc tương tác mệt mỏi. |
Để tìm hiểu sâu hơn cách điều này được làm rõ và cách vận dụng hiểu biết đó, hãy xem xét tỷ lệ chuyển cấp và thời gian đến khi chuyển cấp. Nhóm sẽ chưa biết khách hàng hành xử ra sao cho đến khi có các cuộc gọi thực tế, nhưng có thể xác định những giả thuyết cần kiểm chứng.
Nếu số cuộc gọi được chuyển cấp tăng và khách hàng rời trải nghiệm AI trong 30 giây đầu tiên, nhóm nên điều tra niềm tin, việc thông báo về AI, giọng điệu và cách mở đầu tương tác. Nếu khách hàng chuyển cấp sau khi dành vài phút cố hoàn thành tác vụ, vấn đề nhiều khả năng nằm ở năng lực hoặc phạm vi bao phủ của quy trình.
Con số tổng quan về chuyển cấp vẫn như nhau. Nhưng quyết định về sản phẩm lại khác.
Một cặp chỉ số hữu ích không thể tự chứng minh nguyên nhân. Nó thu hẹp phạm vi điều tra và giúp quyết định tiếp theo rõ ràng hơn.
Ví dụ về Klarna nêu trên cho thấy nguyên tắc này được áp dụng ra sao khi chi phí tương tác với chất lượng dịch vụ. Ví dụ này cho thấy mô hình vận hành có AI hỗ trợ có thể phát triển như thế nào khi công ty theo dõi tác động của các đánh đổi và rút kinh nghiệm từ quá trình triển khai.
Vào tháng 2 năm 2024, công ty báo cáo rằng trợ lý AI đã xử lý 2,3 triệu cuộc hội thoại trong tháng đầu tiên, thực hiện khối lượng công việc tương đương 700 nhân viên toàn thời gian và đạt điểm hài lòng của khách hàng tương đương nhân viên hỗ trợ. Klarna ước tính trợ lý này sẽ đóng góp 40 triệu USD vào mức tăng lợi nhuận trong năm 2024. Đây là kết quả do chính Klarna báo cáo chứ không phải đánh giá độc lập.
Vào tháng 5 năm 2025, giám đốc điều hành Klarna cho biết công ty đã quá chú trọng việc cắt giảm chi phí trong dịch vụ khách hàng và trình bày kế hoạch mở rộng khả năng tiếp cận hỗ trợ từ con người. Điều này thể hiện sự điều chỉnh cán cân giữa dịch vụ tự động và dịch vụ do con người cung cấp, chứ không phải phủ nhận trợ lý AI hay công nghệ nền tảng của nó.
Bằng chứng công khai này cho thấy vì sao cần xem xét các thước đo hiệu quả cùng với nhu cầu của từng nhóm khách hàng và loại tương tác. Một hệ thống AI có thể hoạt động tốt xét trên trung bình, nhưng một số trường hợp phức tạp, nhạy cảm hoặc bất thường vẫn được xử lý tốt hơn nếu có kênh hỗ trợ dễ tiếp cận từ con người.
Theo dõi cả hai phía của mối quan hệ này giúp công ty quyết định nơi tự động hóa tạo ra giá trị, nơi hỗ trợ từ con người vẫn quan trọng và cách điều chỉnh cán cân khi xuất hiện bằng chứng mới.
Các cặp triệt tiêu lẫn nhau khác trong sản phẩm AI có thể gồm:
Cặp triệt tiêu lẫn nhau | Rủi ro mà cặp chỉ số giúp làm rõ |
|---|---|
Độ chính xác của phản hồi ↔ độ trễ phản hồi | Một hệ thống chính xác về mặt kỹ thuật nhưng quá chậm so với quy trình làm việc. |
Hoàn thành tác vụ ↔ tỷ lệ người dùng can thiệp | Một quy trình AI hoàn thành các tác vụ mà người dùng liên tục phải làm lại. |
Chi phí mỗi tương tác ↔ chất lượng đầu ra được đánh giá | Khoản tiết kiệm có được bằng cách làm giảm chất lượng trải nghiệm của khách hàng hoặc nhân viên. |
Mức độ áp dụng ↔ thời gian tạo ra giá trị | Số lượt đăng ký tăng nhưng không tạo ra giá trị tương ứng cho người dùng. |
Mục đích không phải là khiến cả hai thước đo tăng vô hạn. Mục đích là làm rõ sự đánh đổi trước khi tối ưu hóa một chiều gây ra vấn đề vận hành.
Một thách thức liên quan xuất hiện trong dự án triển khai hỗ trợ người chơi cho một công ty trò chơi di động. Hệ thống xử lý những vấn đề có số lượng lớn như mất tiến trình, tranh chấp thanh toán và quyền truy cập tài khoản.
Các thước đo hiệu quả rất quan trọng vì hệ thống hoạt động ở quy mô lớn. Nhưng hỗ trợ người chơi không chỉ đơn thuần là một hàng đợi vận hành. Người chơi thường tìm đến trong trạng thái bực bội vì sự cố đã xảy ra ở một nơi khác trong trải nghiệm của họ.
Trạng thái ban đầu đó làm thay đổi cách diễn giải dữ liệu về mức độ hài lòng của khách hàng. Một người chơi dù được giải quyết vấn đề đúng cách vẫn có thể đánh giá mức hài lòng thấp vì ngay từ đầu họ đã bị mất tiến trình. Nếu đọc điểm số đó mà không xét bối cảnh, tương tác hỗ trợ có thể bị đánh giá thấp vì sự bực bội đã phát sinh từ trước trong hành trình khách hàng.
Vì vậy, nhóm cần phân biệt cảm nhận ban đầu của khách hàng với tác động của trải nghiệm hỗ trợ. Câu hỏi hữu ích hơn không phải là: “Người chơi có hài lòng không?” Mà là: “So với trạng thái ban đầu của người chơi, tương tác này có cải thiện tình hình không?”
Phép so sánh đó có thể giúp phân biệt sự bực bội do sản phẩm gây ra với chất lượng hỗ trợ, miễn là nhóm có cách đáng tin cậy để đo lường cả hai.
Sản phẩm AI thay đổi, nhưng các chỉ số của chúng thường giữ nguyên.
Trong giai đoạn thí điểm, câu hỏi trọng tâm có thể là liệu hệ thống có đủ đáng tin cậy để tiếp tục đầu tư hay không:
Hệ thống có hoàn thành tác vụ cốt lõi một cách đáng tin cậy không?
Người dùng có đủ tin tưởng để tiếp tục sử dụng không?
Hệ thống hoạt động ra sao ngoài những tình huống phổ biến nhất?
Có thể xác định lỗi và khôi phục an toàn không?
Những câu hỏi đó phù hợp với các cặp như:
mức độ thành công của tác vụ cốt lõi ↔ hiệu suất trong trường hợp biên;
tỷ lệ tự động hóa ↔ tỷ lệ con người can thiệp; và
tốc độ hoàn thành ↔ niềm tin của người dùng.
Khi sản phẩm trở nên quan trọng đối với hoạt động vận hành, các câu hỏi sẽ thay đổi:
Hệ thống có thể mở rộng quy mô mà không làm giảm chất lượng không?
Hiệu quả kinh tế có cải thiện khi mức sử dụng tăng không?
Hiệu suất có duy trì ổn định khi mức độ áp dụng tăng không?
Sự can thiệp của con người có diễn ra đúng chỗ không?
Các cặp tương ứng có thể chuyển sang:
chi phí mỗi tương tác ↔ chất lượng đầu ra được đánh giá;
độ rộng áp dụng ↔ độ sâu sử dụng; và
tỷ lệ tự động hóa ↔ mức độ phơi nhiễm rủi ro vận hành.
Các chỉ số ban đầu không nhất thiết là sai. Chúng trả lời những câu hỏi quan trọng ở giai đoạn trước.
Rủi ro xuất hiện trong quá trình chuyển đổi. Các chỉ số thí điểm thường được duy trì vì nhóm biết cách báo cáo các chỉ số đó và không ai chịu trách nhiệm quyết định ngừng sử dụng. Những thước đo từng hỗ trợ học hỏi có thể dần trở thành các chỉ số phù phiếm.
Vì vậy, các cặp chỉ số nên có vòng đời. Các nhóm nên đưa từng cặp vào để phục vụ một quyết định cụ thể, xem xét liệu cặp đó còn làm rõ một đánh đổi đáng kể hay không và ngừng sử dụng khi sản phẩm hoặc quyết định thay đổi.
Các hệ thống AI đòi hỏi khả năng quan sát chi tiết, cảnh báo, bảo đảm chất lượng và đánh giá. Loại bỏ những tín hiệu đó sẽ khiến việc vận hành sản phẩm an toàn trở nên khó khăn hơn. Nhưng giám sát vận hành không giống đo lường dành cho lãnh đạo.
Hoạt động giám sát giúp nhóm phát hiện sự cố, truy vết lỗi và hiểu hành vi hệ thống. Các chỉ số ra quyết định giúp lãnh đạo sản phẩm và kinh doanh quyết định nên đầu tư, can thiệp, đổi hướng hay chấp nhận một đánh đổi.
Một tổ chức có thể theo dõi hàng trăm tín hiệu kỹ thuật và vận hành nhưng chỉ đưa hai hoặc ba cặp triệt tiêu lẫn nhau lên cấp quyết định đối với một quyết định cụ thể về sản phẩm. Giữ lớp quyết định này tinh gọn giúp việc ưu tiên dễ dàng hơn.
Tần suất rà soát phù hợp tùy thuộc vào sản phẩm. Một hệ thống mới hoặc thay đổi nhanh có thể cần rà soát quyết định hằng tuần, còn sản phẩm trưởng thành có thể áp dụng chu kỳ hằng tháng hoặc hằng quý. Nguyên tắc quan trọng hơn khoảng thời gian: hãy rà soát cặp chỉ số đủ thường xuyên để hành động trước khi đánh đổi trở nên tốn kém hoặc mất an toàn.
Một cặp chỉ số chỉ trở nên hữu ích khi tổ chức thống nhất sẽ làm gì nếu nó xấu đi.
Điều đó đòi hỏi nhiều hơn việc xác định một giới hạn đỏ cho sự phân kỳ. Các nhóm nên xem xét ba tình trạng:
Thất bại tuyệt đối: một thước đo vượt ngưỡng không thể chấp nhận, bất kể thước đo kia.
Phân kỳ: một thước đo cải thiện trong khi thước đo đối trọng xấu đi.
Cùng suy giảm: cả hai phía đều giảm, cho thấy vấn đề rộng hơn về sản phẩm hoặc vận hành.
Mỗi cặp chỉ số cần có:
một người phụ trách được chỉ định;
một quyết định rõ ràng mà nó hỗ trợ;
các ngưỡng hoặc tiêu chí đánh giá đã thống nhất;
một quy trình điều tra; và
một tập hợp biện pháp can thiệp khả thi.
Nếu thiếu những yếu tố đó, tổ chức chỉ đang quan sát sản phẩm chứ chưa thực sự quản lý nó.
Trước khi thêm một thước đo khác, hãy chọn một quyết định quan trọng về sản phẩm và lần lượt trả lời các câu hỏi sau. Hãy ghi lại câu trả lời để kết thúc buổi rà soát với bước tiếp theo đã được thống nhất.
1. Chúng ta cần những chỉ số này hỗ trợ quyết định nào?
Hãy cụ thể: chúng ta đang quyết định có nên mở rộng tự động hóa, thay đổi mô hình hay cải thiện việc bàn giao cho con người? Hãy xác định quyết định trước khi chọn thước đo.
2. Nếu con số này cải thiện, điều gì có thể xấu đi?
Xác định kết quả cần bảo vệ và một thước đo có thể phát hiện tác hại. Ví dụ, ghép chi phí mỗi tương tác với chất lượng đầu ra được đánh giá để kiểm tra xem câu trả lời rẻ hơn có còn hữu ích hay không.
3. Các con số nổi bật có thể đang che giấu điều gì?
Hãy xem cả hai thước đo trên cùng nhóm người dùng, tác vụ và khoảng thời gian, rồi tìm những nhóm đang nhận kết quả kém hơn. Cũng cần xem xét trạng thái ban đầu: mức độ hài lòng thấp có thể phản ánh sự bực bội đã có từ trước khi tương tác hỗ trợ diễn ra.
4. Điều gì sẽ khiến chúng ta hành động và ai chịu trách nhiệm ứng phó?
Đặt tiêu chí hành động khi một thước đo vượt giới hạn không thể chấp nhận, một thước đo cải thiện còn thước đo kia xấu đi, hoặc cả hai cùng suy giảm. Thống nhất ai sẽ điều tra, họ sẽ kiểm tra điều gì trước và khi nào sẽ báo cáo lại.
5. Cặp chỉ số này còn phù hợp với giai đoạn hiện tại của sản phẩm không?
Quyết định nên giữ lại, thay thế hay ngừng sử dụng nó. Giai đoạn thí điểm có thể tập trung vào độ tin cậy của tác vụ và niềm tin của người dùng; dịch vụ đang vận hành có thể cần giám sát chi phí và chất lượng chặt chẽ hơn. Đặt ngày xem xét lại lựa chọn này.
Việc đo lường sản phẩm AI không nên chỉ mô tả hiệu suất. Nó phải làm rõ những đánh đổi mà tổ chức đang thực hiện và giúp quyết định tiếp theo trở nên rõ ràng hơn.