การติดตามผลกระทบจากสิ่งที่ต้องแลกเมื่อสร้างผลิตภัณฑ์ AI

การมองเห็นผลได้ผลเสียที่ซ่อนอยู่ช่วยให้ทีมวิเคราะห์ได้ว่าผลิตภัณฑ์ AI มีปัญหาจากจุดใด และช่วยให้ตัดสินใจได้ดีขึ้น

ประเด็นสำคัญสำหรับผู้บริหาร

  • การเพิ่มตัวชี้วัดไม่ได้ช่วยให้เข้าใจสถานการณ์ได้ดีขึ้นเสมอไป แดชบอร์ดจำนวนมากมีตัวชี้วัดหลายรายการที่สะท้อนพฤติกรรมพื้นฐานเดียวกัน ตัวชี้วัดจะช่วยวิเคราะห์หาสาเหตุของปัญหาได้ดีขึ้นเมื่อนำตัวชี้วัดที่มีผลกระทบต่อกันมาพิจารณาเป็นคู่ เช่น ต้นทุนกับคุณภาพ การจัดการคำขอได้ภายในระบบกับความรู้สึกของลูกค้า หรือความแม่นยำกับเวลาในการตอบสนอง

  • ตัวชี้วัดที่ควรนำมาพิจารณาควบคู่กันจะเปลี่ยนไปเมื่อผลิตภัณฑ์ AI พัฒนาจากช่วงทดลองไปสู่การใช้งานจริง ดังนั้น การวัดผลควรสอดคล้องกับสิ่งที่ทีมต้องใช้ประกอบการตัดสินใจในแต่ละช่วง

  • การติดตามการดำเนินงานและการวัดผลเชิงกลยุทธ์มีวัตถุประสงค์ต่างกัน ทีมอาจติดตามสัญญาณการทำงานของระบบหลายร้อยรายการ แต่เลือกพิจารณาตัวชี้วัดควบคู่กันเพียงไม่กี่คู่เพื่อใช้ประกอบการตัดสินใจเกี่ยวกับผลิตภัณฑ์

ตัวชี้วัดหลักอาจทำให้ผลลัพธ์ดูน่าเชื่อถือ แต่ยังไม่ให้คำตอบสำหรับการตัดสินใจสำคัญเกี่ยวกับผลิตภัณฑ์

ผู้ช่วย AI ของ Klarna เคยเป็นที่รู้จักกันดีว่าช่วยให้บริษัทจัดการคำขอของลูกค้าได้มากขึ้นด้วยต้นทุนที่ลดลง ขณะที่คะแนนความพึงพอใจของลูกค้าอยู่ในระดับใกล้เคียงกับเอเจนต์ที่เป็นมนุษย์ แต่ในปีถัดมา บริษัทกลับเพิ่มโอกาสให้ลูกค้าเข้าถึงพนักงานฝ่ายบริการมากขึ้น โดยประธานเจ้าหน้าที่บริหารยอมรับว่าก่อนหน้านี้บริษัทมุ่งเน้นการลดต้นทุนมากเกินไป

นี่ไม่ใช่การปฏิเสธผู้ช่วย AI หรือเทคโนโลยีที่อยู่เบื้องหลัง แต่เป็นการปรับสมดุลระหว่างระบบอัตโนมัติกับการให้บริการโดยมนุษย์ โดยอาศัยบทเรียนที่บริษัทได้รับจากการใช้งานผลิตภัณฑ์จริง เมื่อระบบอัตโนมัติเข้ามารับมือกับคำถามง่ายๆ ที่มีจำนวนมากขึ้น Klarna จึงต้องการเจ้าหน้าที่ที่มีทักษะในการจัดการกรณีที่ซับซ้อนและละเอียดอ่อน

ตัวชี้วัดที่มากขึ้นไม่ได้ช่วยให้เห็นภาพชัดเจนขึ้นเสมอไป

เมื่อตั้งแต่แรกได้กำหนดไว้อย่างชัดเจนแล้วว่าผลิตภัณฑ์ควรบรรลุเป้าหมายอะไร ในที่สุด องค์กรส่วนใหญ่ที่พัฒนาผลิตภัณฑ์ AI ก็จะต้องเผชิญกับคำถามเดียวกันว่า ผลิตภัณฑ์นั้นได้ผลจริงหรือไม่

หากยังตอบคำถามนี้ไม่ได้อย่างชัดเจน หลายทีมมักเลือกเพิ่มตัวชี้วัด จาก 3 รายการเป็น 10 และจาก 10 เป็น 30 แดชบอร์ดจึงมีข้อมูลมากขึ้นเรื่อยๆ แต่ทีมอาจไม่ได้เข้าใจสิ่งที่เกิดขึ้นมากขึ้นตามไปด้วย

ปัญหาไม่ได้อยู่ที่คุณภาพของตัวชี้วัดแต่ละรายการเสมอไป แต่อยู่ที่ความสัมพันธ์ระหว่างตัวชี้วัดเหล่านั้น ความพึงพอใจของลูกค้า คะแนน Net Promoter Score รีวิว และอัตราการกดถูกใจ ล้วนให้ข้อมูลที่เป็นประโยชน์ได้ แต่ตัวชี้วัดเหล่านี้อาจสะท้อนการเปลี่ยนแปลงของความรู้สึกโดยรวมของลูกค้าในลักษณะเดียวกัน เมื่อทั้งหมดเปลี่ยนแปลงไปในทิศทางเดียวกัน เราจะรู้ว่ามีบางอย่างเกิดขึ้น แต่ไม่ได้หมายความว่าจะรู้ว่าเกิดขึ้นเพราะเหตุใด

ดังนั้น ทีม AI จึงควรมองให้ไกลกว่าตัวชี้วัดที่เปลี่ยนแปลงไปในทิศทางเดียวกัน และระบุตัวชี้วัดที่ช่วยให้เห็น ผลลัพธ์ที่อาจขัดแย้งกัน การนำตัวชี้วัดลักษณะนี้มาพิจารณาควบคู่กันจะช่วยให้ทีมมองเห็นและติดตามผลกระทบจากการสร้างสมดุลระหว่างปัจจัยต่างๆ ที่ส่งผลต่อประสิทธิภาพของผลิตภัณฑ์ และช่วยให้ตัดสินใจได้ดีขึ้น

การติดตามผลได้ผลเสียในการสร้างเอเจนต์เสียงแบบเรียลไทม์: เมื่อการเพิ่มตัวชี้วัดไม่ได้ช่วยให้เข้าใจมากขึ้น

ในการนำระบบไปใช้งานจริงก่อนเปิดตัวครั้งหนึ่ง ทีมที่ทำงานร่วมกันกำลังพัฒนาเอเจนต์เสียง AI แบบเรียลไทม์สำหรับรับสายลูกค้าที่ติดต่อฝ่ายบริการ หนึ่งในโจทย์ที่ยากที่สุดไม่ได้อยู่ที่การเลือกโมเดลหรือการประสานการทำงานของระบบ แต่อยู่ที่ว่า เมื่อมีลูกค้าเริ่มใช้งานผลิตภัณฑ์ในวงกว้างแล้ว องค์กรจะรู้ได้อย่างไรว่าผลิตภัณฑ์ทำงานได้ตามเป้าหมาย

กรอบการวัดผลในช่วงแรกประกอบด้วยตัวชี้วัด 3 รายการ ได้แก่

  • อัตราการแก้ไขปัญหาโดยไม่ต้องส่งต่อ: ความถี่ที่ AI สามารถจัดการปัญหาของลูกค้าทางโทรศัพท์ได้โดยไม่ต้องโอนสายให้พนักงาน

  • อัตราการโอนสายให้พนักงาน: ความถี่ที่ต้องโอนสายจาก AI ไปให้เจ้าหน้าที่ที่เป็นมนุษย์รับช่วงต่อ

  • อัตราการแก้ไขปัญหาสำเร็จ: สัดส่วนของกรณีที่ปัญหาของลูกค้าได้รับการแก้ไขจนสำเร็จในท้ายที่สุด

ตัวชี้วัดแต่ละรายการต่างก็มีเหตุผลในตัวเอง แต่เมื่อพิจารณาร่วมกัน กลับยังไม่สามารถตอบคำถามสำคัญที่เห็นได้ชัดว่า หากอัตราการส่งต่อสายเพิ่มขึ้น นั่นบอกอะไรเราได้บ้าง

ทีมได้แยกการส่งต่อสายออกเป็น 8 ประเภทย่อย จากนั้นจึงเพิ่มตัวชี้วัดด้านการวางสายก่อนจบการสนทนา เส้นทางการใช้บริการและระยะเวลา คะแนนความเข้าใจภาษา และอัตราการแก้ไขปัญหาสำเร็จแยกตามประเภทคำขอ จนในที่สุด กรอบการวัดผลนี้มีตัวชี้วัดทั้งหมด 31 รายการใน 6 หมวดหมู่

แม้ทีมจะมองเห็นรายละเอียดของการส่งต่อสายได้ชัดขึ้น แต่ก็ยังไม่สามารถวินิจฉัยสาเหตุได้อย่างน่าเชื่อถือ เนื่องจากตัวชี้วัดส่วนใหญ่สะท้อนพฤติกรรมเดียวกัน จึงมีแนวโน้มเปลี่ยนแปลงไปพร้อมกัน มากกว่าจะช่วยทดสอบคำอธิบายที่แตกต่างกันเกี่ยวกับสาเหตุของปัญหา

แดชบอร์ดจึงกลายเป็นเครื่องมือสังเกตการณ์แทนที่จะใช้วินิจฉัย

พิจารณาตัวชี้วัดที่ให้ผลสวนทางกันเป็นคู่ เพื่อให้เห็นผลได้ผลเสียที่ต้องแลก

สิ่งที่ทีมต้องการไม่ใช่การแยกข้อมูลออกเป็นรายละเอียดยิ่งขึ้น แต่เป็น ตัวชี้วัดที่เมื่อนำมาพิจารณาควบคู่กันแล้วช่วยให้เห็นผลกระทบที่แต่ละด้านมีต่อกัน

เราเรียกตัวชี้วัดประเภทนี้ว่า คู่ตัวชี้วัดที่อาจส่งผลเสียต่อกัน หมายถึงตัวชี้วัดสองด้านที่หากมุ่งปรับปรุงด้านหนึ่งเพียงอย่างเดียว อาจกระทบผลลัพธ์ของอีกด้านในทางลบ คำเรียกนี้อธิบายลักษณะของปัญหาที่เกิดจากการให้ความสำคัญกับด้านเดียว ไม่ใช่สภาวะที่ต้องการ

หากผลลัพธ์ทั้งสองด้านยังอยู่ในระดับที่ดี ผลิตภัณฑ์ก็อาจทำงานได้อย่างยั่งยืน แต่หากผลลัพธ์เริ่มเปลี่ยนไปคนละทิศทาง ลักษณะของความแตกต่างนั้นจะช่วยให้ทีมรู้ว่าควรตรวจสอบจุดใดต่อ

สิ่งที่เรามีอยู่เดิม

คู่ตัวชี้วัดที่อาจส่งผลเสียต่อกัน

สิ่งที่อาจเห็นได้เมื่อนำตัวชี้วัดมาพิจารณาควบคู่กัน

อัตราการส่งต่อสายที่แบ่งออกเป็น 8 ประเภทย่อย

อัตราการส่งต่อสาย ↔ ระยะเวลาก่อนส่งต่อสาย

หากมีการส่งต่อสายทันที อาจบ่งชี้ว่าลูกค้าไม่มั่นใจในระบบหรือมีปัญหากับวิธีที่ระบบเริ่มต้นการสนทนา ส่วนการส่งต่อสายหลังจากสนทนาไประยะหนึ่งอาจบ่งชี้ว่าระบบไม่สามารถดำเนินการตามคำขอให้สำเร็จได้

อัตราการจัดการสายได้โดยไม่ต้องส่งต่อและอัตราการแก้ไขปัญหาสำเร็จที่รายงานแยกจากกัน

อัตราการจัดการสายได้โดยไม่ต้องส่งต่อ ↔ ความรู้สึกของลูกค้า

การจัดการสายได้โดยไม่ต้องส่งต่อนั้นหมายถึงลูกค้าได้รับการแก้ไขปัญหาจนพอใจ หรือเกิดจากลูกค้าถอดใจและยุติการติดต่อ

อัตราการแก้ปัญหาสำเร็จแยกตามประเภทเจตนา

อัตราการแก้ไขปัญหาสำเร็จ ↔ ความยาวของการสนทนา

การแก้ไขปัญหาสำเร็จนั้นทำได้อย่างมีประสิทธิภาพ หรือกว่าจะแก้ปัญหาได้ ลูกค้าต้องผ่านการสนทนาที่ยืดเยื้อและเหนื่อยล้า

หากเจาะลึกลงไปว่าคู่ตัวชี้วัดช่วยให้เห็นอะไรและทีมควรนำข้อมูลที่ได้ไปใช้อย่างไร ลองพิจารณาอัตราการส่งต่อสายควบคู่กับระยะเวลาก่อนส่งต่อสาย แม้ทีมจะยังไม่รู้ว่าลูกค้าจะมีพฤติกรรมอย่างไรจนกว่าจะมีการใช้งานจริง แต่สามารถกำหนดสมมติฐานที่จำเป็นต้องทดสอบไว้ก่อนได้

หากมีสายถูกส่งต่อให้พนักงานมากขึ้นและลูกค้าเลิกใช้ AI ภายใน 30 วินาทีแรก ทีมควรตรวจสอบว่าปัญหาเกิดจากความไว้วางใจ การแจ้งให้ลูกค้าทราบว่ากำลังสนทนากับ AI น้ำเสียง และวิธีเริ่มต้นการสนทนา แต่หากลูกค้าพยายามทำรายการอยู่หลายนาทีก่อนขอส่งต่อให้พนักงาน ปัญหาก็มีแนวโน้มที่จะอยู่ที่ความสามารถของระบบหรือขั้นตอนการทำงานที่ระบบยังรองรับได้ไม่ครอบคลุม

แม้อัตราการส่งต่อสายโดยรวมจะเป็นตัวเลขเดียวกัน แต่การตัดสินใจที่ทีมควรทำเกี่ยวกับผลิตภัณฑ์อาจต่างกัน

คู่ตัวชี้วัดที่มีประโยชน์ไม่ได้ช่วยยืนยันสาเหตุได้ด้วยตัวเอง แต่ช่วยจำกัดขอบเขตในการหาสาเหตุให้แคบลง และทำให้เห็นชัดขึ้นว่าควรตัดสินใจอย่างไรต่อไป

ต้องพิจารณาต้นทุนและคุณภาพควบคู่กัน

ตัวอย่างของ Klarna ที่กล่าวถึงก่อนหน้านี้แสดงให้เห็นว่าหลักการนี้นำมาใช้ได้อย่างไรเมื่อต้นทุนและคุณภาพการบริการส่งผลต่อกัน และยังแสดงให้เห็นว่ารูปแบบการดำเนินงานที่นำ AI มาใช้อาจปรับเปลี่ยนไปอย่างไร เมื่อบริษัทติดตามผลกระทบจากการต้องสร้างสมดุลระหว่างสองด้านและเรียนรู้จากการนำระบบไปใช้งานจริง

ในเดือนกุมภาพันธ์ 2567 บริษัทเปิดเผยว่า ผู้ช่วย AI ของบริษัทจัดการบทสนทนาไปแล้ว 2.3 ล้านครั้งในเดือนแรก ทำงานได้ในปริมาณเทียบเท่ากับเจ้าหน้าที่ที่ทำงานเต็มเวลา 700 คน และทำคะแนนความพึงพอใจของลูกค้าได้ใกล้เคียงกับเจ้าหน้าที่ที่เป็นมนุษย์ Klarna ประเมินว่าผู้ช่วย AI จะช่วยเพิ่มผลกำไรได้ 40 ล้านดอลลาร์ในปี 2567 ทั้งหมดนี้เป็นผลลัพธ์ที่ Klarna รายงานเอง ไม่ใช่ผลจากการประเมินโดยหน่วยงานอิสระ

ในเดือนพฤษภาคม 2568 ประธานเจ้าหน้าที่บริหารของ Klarna กล่าวว่า บริษัทให้ความสำคัญกับการลดต้นทุนด้านบริการลูกค้ามากเกินไป และเปิดเผยแผนที่จะเพิ่มช่องทางให้ลูกค้าเข้าถึงบริการจากพนักงานได้มากขึ้น การเปลี่ยนแปลงนี้เป็นการปรับสมดุลระหว่างบริการแบบอัตโนมัติกับบริการจากพนักงาน ไม่ใช่การปฏิเสธผู้ช่วย AI หรือเทคโนโลยีที่อยู่เบื้องหลัง

ข้อมูลที่เปิดเผยต่อสาธารณะแสดงให้เห็นว่าเหตุใดจึงควรพิจารณาตัวชี้วัดด้านประสิทธิภาพควบคู่กับความต้องการที่แตกต่างกันของลูกค้าและการให้บริการแต่ละรูปแบบ ระบบ AI อาจทำงานได้ดีในภาพรวม แต่กรณีที่ซับซ้อน ละเอียดอ่อน หรือพบได้ไม่บ่อยบางกรณี อาจยังเหมาะกับการมีช่องทางให้ติดต่อพนักงานได้โดยง่าย

การติดตามผลลัพธ์ทั้งสองด้านควบคู่กันช่วยให้บริษัทตัดสินใจได้ว่า ควรใช้ระบบอัตโนมัติในส่วนใดจึงจะสร้างคุณค่า ส่วนใดยังจำเป็นต้องมีพนักงานคอยให้ความช่วยเหลือ และควรปรับสมดุลระหว่างสองด้านอย่างไรเมื่อมีข้อมูลใหม่เพิ่มขึ้น

คู่ตัวชี้วัดที่อาจส่งผลเสียต่อกันสำหรับผลิตภัณฑ์ AI ประเภทอื่นๆ อาจมีดังนี้:

คู่ตัวชี้วัดที่อาจส่งผลเสียต่อกัน

ความเสี่ยงที่สังเกตได้จากคู่ตัวชี้วัด

ความแม่นยำของคำตอบ ↔ ความเร็วในการตอบกลับ

ระบบให้คำตอบที่ถูกต้องในเชิงเทคนิค แต่ตอบช้าเกินกว่าจะนำไปใช้ในขั้นตอนการทำงานจริงได้

อัตราการทำงานสำเร็จ ↔ อัตราที่ผู้ใช้เข้ามาแก้ไขผลลัพธ์เอง

ขั้นตอนการทำงานด้วย AI ที่ดูเหมือนทำงานสำเร็จ แต่ผู้ใช้ต้องกลับมาแก้หรือทำใหม่ซ้ำๆ

ต้นทุนต่อการโต้ตอบ ↔ คุณภาพของผลลัพธ์จากการประเมิน

การประหยัดต้นทุนด้วยการลดทอนประสบการณ์ของลูกค้าหรือพนักงาน

การนำไปใช้ ↔ ระยะเวลากว่าจะเห็นประโยชน์

จำนวนผู้สมัครใช้งานเพิ่มขึ้น แต่ผู้ใช้ไม่ได้รับประโยชน์เพิ่มขึ้นตามไปด้วย

เป้าหมายไม่ใช่การทำให้ตัวชี้วัดทั้งสองเพิ่มขึ้นอย่างต่อเนื่อง แต่คือการทำให้เห็นผลได้ผลเสียระหว่างสองด้าน ก่อนที่การมุ่งปรับปรุงเพียงด้านเดียวจะก่อให้เกิดปัญหาในการดำเนินงาน

สถานการณ์ของลูกค้าก่อนเริ่มใช้งานส่งผลต่อความหมายของตัวชี้วัด

ความท้าทายในลักษณะเดียวกันเกิดขึ้นระหว่างการนำระบบไปใช้กับงานช่วยเหลือผู้เล่นของบริษัทเกมมือถือแห่งหนึ่ง ระบบต้องรองรับปัญหาที่มีผู้เล่นติดต่อเข้ามาเป็นจำนวนมาก เช่น ความคืบหน้าในการเล่นเกมหายไป ข้อพิพาทด้านการชำระเงิน และการเข้าใช้งานบัญชี

ตัวชี้วัดด้านประสิทธิภาพมีความสำคัญ เพราะระบบต้องรองรับการใช้งานในวงกว้าง แต่การช่วยเหลือผู้เล่นไม่ได้เป็นเพียงการจัดการคำขอที่เข้ามาตามลำดับเท่านั้น ผู้เล่นมักติดต่อเข้ามาด้วยความไม่พอใจ เพราะก่อนหน้านั้นได้พบปัญหาบางอย่างจากการเล่นเกมอยู่แล้ว

สถานการณ์ก่อนที่ผู้เล่นจะติดต่อฝ่ายช่วยเหลือมีผลต่อการตีความข้อมูลความพึงพอใจของลูกค้า แม้ปัญหาของผู้เล่นจะได้รับการแก้ไขอย่างถูกต้อง แต่ผู้เล่นก็อาจยังให้คะแนนความพึงพอใจต่ำ เพราะต้องสูญเสียความคืบหน้าในเกมตั้งแต่แรก หากดูเฉพาะคะแนนโดยไม่คำนึงถึงบริบท ก็อาจทำให้การให้บริการของฝ่ายช่วยเหลือดูแย่ ทั้งที่ความไม่พอใจนั้นเกิดขึ้นก่อนผู้เล่นจะติดต่อขอความช่วยเหลือ

ดังนั้น ทีมจึงต้องแยกให้ออกระหว่างความรู้สึกของลูกค้าก่อนเริ่มติดต่อกับผลที่เกิดจากประสบการณ์ในการรับความช่วยเหลือ คำถามที่มีประโยชน์กว่าจึงไม่ใช่ “ผู้เล่นพอใจหรือไม่” แต่เป็น “หลังจากได้รับความช่วยเหลือแล้ว สถานการณ์ดีขึ้นจากตอนที่ผู้เล่นเริ่มติดต่อหรือไม่”

การเปรียบเทียบนี้จะช่วยแยกได้ว่า ความไม่พอใจเกิดจากตัวผลิตภัณฑ์หรือจากคุณภาพของการให้ความช่วยเหลือ ตราบใดที่ทีมมีวิธีวัดทั้งสองด้านได้อย่างน่าเชื่อถือ

การวัดผลควรเปลี่ยนไปตามผลิตภัณฑ์

ผลิตภัณฑ์ AI เปลี่ยนแปลงอยู่เสมอ แต่ตัวชี้วัดที่ใช้กลับมักไม่เปลี่ยนตาม

ในช่วงทดลอง คำถามสำคัญอาจเป็นว่าระบบมีความน่าเชื่อถือมากพอที่จะลงทุนพัฒนาต่อหรือไม่:

  • ระบบสามารถทำงานหลักให้สำเร็จได้อย่างน่าเชื่อถือหรือไม่

  • ผู้ใช้ไว้วางใจระบบมากพอที่จะใช้งานต่อหรือไม่

  • ระบบรับมือกับสถานการณ์ที่ไม่ใช่กรณีทั่วไปได้อย่างไร

  • สามารถตรวจพบความล้มเหลวและกู้คืนระบบได้อย่างปลอดภัยหรือไม่

คำถามเหล่านี้เหมาะกับการพิจารณาตัวชี้วัดเป็นคู่ เช่น:

  • อัตราการทำงานหลักสำเร็จ ↔ ความสามารถในการรับมือกับกรณีที่พบไม่บ่อย

  • อัตราการทำงานแบบอัตโนมัติ ↔ อัตราที่พนักงานต้องเข้ามาแก้ไขหรือรับช่วงต่อ และ

  • ความเร็วในการทำงานจนสำเร็จ ↔ ความมั่นใจของผู้ใช้

เมื่อผลิตภัณฑ์เริ่มมีบทบาทสำคัญต่อการดำเนินงาน คำถามที่ทีมต้องตอบก็จะเปลี่ยนไป:

  • ระบบสามารถรองรับการใช้งานที่เพิ่มขึ้นโดยไม่ทำให้คุณภาพลดลงได้หรือไม่

  • เมื่อมีการใช้งานมากขึ้น ต้นทุนต่อการใช้งานลดลงหรือไม่

  • เมื่อมีผู้ใช้นำระบบไปใช้มากขึ้น ประสิทธิภาพยังคงอยู่ในระดับที่เสถียรหรือไม่

  • พนักงานเข้ามารับช่วงต่อในกรณีที่เหมาะสมหรือไม่

ตัวชี้วัดที่ควรนำมาพิจารณาควบคู่กันอาจเปลี่ยนเป็น:

  • ต้นทุนต่อการโต้ตอบ ↔ คุณภาพของผลลัพธ์จากการประเมิน

  • ความครอบคลุมของการนำไปใช้ ↔ ระดับการใช้งานเชิงลึก และ

  • อัตราการทำงานแบบอัตโนมัติ ↔ ความเสี่ยงด้านการดำเนินงาน

ตัวชี้วัดที่ใช้ในช่วงแรกไม่ได้หมายความว่าไม่เหมาะสม แต่เป็นตัวชี้วัดที่ตอบโจทย์สำคัญของผลิตภัณฑ์ในช่วงเวลานั้น

ความเสี่ยงมักเกิดขึ้นเมื่อผลิตภัณฑ์เปลี่ยนผ่านไปสู่ขั้นต่อไป ตัวชี้วัดจากช่วงทดลองมักถูกใช้ต่อเพราะทีมรู้วิธีติดตามและรายงานผลอยู่แล้ว ขณะที่ไม่มีผู้รับผิดชอบชัดเจนในการตัดสินใจยกเลิกตัวชี้วัดเหล่านั้น สิ่งที่เคยช่วยให้ทีมเรียนรู้จึงอาจค่อยๆ กลายเป็นตัวชี้วัดที่ทำให้ผลงานดูดี แต่ไม่ได้ให้ข้อมูลที่มีประโยชน์ต่อการตัดสินใจ

ดังนั้น คู่ตัวชี้วัดควรมีช่วงเวลาการใช้งานที่ชัดเจน ทีมควรนำมาใช้เพื่อประกอบการตัดสินใจในเรื่องที่กำหนดไว้ ทบทวนว่ายังช่วยให้เห็นผลได้ผลเสียที่สำคัญระหว่างสองด้านหรือไม่ และเลิกใช้เมื่อผลิตภัณฑ์หรือสิ่งที่ทีมต้องตัดสินใจเปลี่ยนไป

การติดตามการทำงานและการตัดสินใจเป็นคนละส่วนกัน

ระบบ AI จำเป็นต้องมีข้อมูลอย่างละเอียดเพื่อให้มองเห็นการทำงานของระบบ การแจ้งเตือน การประกันคุณภาพ และการประเมินผล หากตัดข้อมูลเหล่านี้ออก ก็จะยิ่งทำให้ดูแลระบบให้ทำงานได้อย่างปลอดภัยได้ยากขึ้น อย่างไรก็ตาม การติดตามการทำงานของระบบไม่เหมือนกับการวัดผลที่ผู้บริหารใช้ประกอบการตัดสินใจ

การติดตามการทำงานช่วยให้ทีมตรวจพบปัญหา ไล่หาสาเหตุเมื่อระบบทำงานผิดพลาด และเข้าใจว่าระบบมีพฤติกรรมอย่างไร ขณะที่ตัวชี้วัดสำหรับการตัดสินใจช่วยให้ผู้นำด้านผลิตภัณฑ์และธุรกิจพิจารณาว่าควรลงทุน เข้าไปดำเนินการ ปรับทิศทาง หรือยอมรับผลกระทบที่ต้องแลกกับผลลัพธ์อีกด้าน

องค์กรอาจติดตามสัญญาณด้านเทคนิคและการดำเนินงานหลายร้อยรายการ แต่เลือกพิจารณา คู่ตัวชี้วัดที่อาจส่งผลเสียต่อกัน เพียง 2 หรือ 3 คู่สำหรับการตัดสินใจเกี่ยวกับผลิตภัณฑ์ในเรื่องใดเรื่องหนึ่ง การจำกัดตัวชี้วัดที่ใช้ตัดสินใจให้เหลือเพียงไม่กี่รายการจะช่วยให้จัดลำดับความสำคัญได้ง่ายขึ้น

ความถี่ในการทบทวนที่เหมาะสมขึ้นอยู่กับลักษณะของผลิตภัณฑ์ ระบบใหม่หรือระบบที่เปลี่ยนแปลงอย่างรวดเร็วอาจต้องทบทวนข้อมูลเพื่อประกอบการตัดสินใจทุกสัปดาห์ ส่วนผลิตภัณฑ์ที่มีความเสถียรแล้วอาจทบทวนเป็นรายเดือนหรือรายไตรมาส สิ่งสำคัญกว่าความถี่คือหลักการที่ว่า ควรติดตามตัวชี้วัดแต่ละคู่บ่อยพอที่จะเข้าไปปรับแก้ได้ก่อนที่ผลได้ผลเสียระหว่างสองด้านจะสร้างต้นทุนสูงหรือก่อให้เกิดความเสี่ยง

กำหนดให้ชัดเจนว่าผลจากตัวชี้วัดแต่ละคู่ควรนำไปสู่การดำเนินการใด

การพิจารณาตัวชี้วัดเป็นคู่จะมีประโยชน์ก็ต่อเมื่อองค์กรกำหนดไว้แล้วว่าจะต้องทำอะไรหากผลที่ได้เริ่มแย่ลง

การกำหนดเพียงจุดเตือนว่าผลลัพธ์ของตัวชี้วัดทั้งสองแตกต่างกันถึงระดับใดจึงต้องดำเนินการนั้นไม่เพียงพอ ทีมควรพิจารณาเงื่อนไข 3 ข้อ ได้แก่

  • ผลลัพธ์ที่ยอมรับไม่ได้: ตัวชี้วัดด้านใดด้านหนึ่งแตะระดับที่ไม่สามารถยอมรับได้ โดยไม่ขึ้นอยู่กับผลของอีกด้าน

  • การเปลี่ยนไปคนละทิศทาง: ตัวชี้วัดด้านหนึ่งดีขึ้น ในขณะที่ตัวชี้วัดอีกด้านที่ช่วยถ่วงดุลกลับมีผลลัพธ์แย่ลง

  • ผลลัพธ์ที่แย่ลงทั้งสองด้าน: ตัวชี้วัดทั้งสองด้านแย่ลงพร้อมกัน ซึ่งอาจบ่งชี้ว่ามีปัญหาในภาพรวมของผลิตภัณฑ์หรือการดำเนินงาน

ตัวชี้วัดแต่ละคู่ควรมีองค์ประกอบดังต่อไปนี้:

  • ผู้รับผิดชอบที่ระบุไว้อย่างชัดเจน

  • การตัดสินใจที่ต้องใช้ตัวชี้วัดคู่นี้ประกอบอย่างชัดเจน

  • เกณฑ์หรือหลักเกณฑ์การประเมินที่ตกลงร่วมกัน

  • แนวทางการตรวจสอบ และ

  • ชุดมาตรการที่อาจนำมาใช้

หากขาดองค์ประกอบเหล่านี้ องค์กรจะทำได้เพียงติดตามสิ่งที่เกิดขึ้นกับผลิตภัณฑ์ แต่ยังไม่สามารถบริหารจัดการผลิตภัณฑ์ได้อย่างแท้จริง

5 คำถามสำหรับการทบทวนตัวชี้วัดครั้งถัดไป

ก่อนจะเพิ่มตัวชี้วัดอีกหนึ่งรายการ ให้เลือก เรื่องสำคัญเกี่ยวกับผลิตภัณฑ์ที่ทีมต้องตัดสินใจ แล้วตอบคำถามต่อไปนี้ให้ครบ พร้อมบันทึกคำตอบไว้ เพื่อให้การทบทวนจบลงด้วยข้อสรุปร่วมกันว่าขั้นตอนถัดไปคืออะไร

1. เราต้องการให้ตัวชี้วัดเหล่านี้ช่วยในการตัดสินใจเรื่องใด

กำหนดเรื่องที่จะตัดสินใจให้ชัด เช่น เรากำลังพิจารณาว่าควรเพิ่มการทำงานแบบอัตโนมัติ เปลี่ยนโมเดล หรือปรับปรุงขั้นตอนการส่งต่อให้พนักงาน ก่อนเลือกตัวชี้วัด ให้ระบุการตัดสินใจนั้นให้ชัดเจนก่อน

2. หากตัวเลขนี้ดีขึ้น มีอะไรที่อาจแย่ลงบ้าง

ระบุผลลัพธ์ที่ต้องรักษาไว้ และเลือกตัวชี้วัดที่ช่วยให้เห็นหากผลลัพธ์นั้นได้รับผลกระทบ เช่น พิจารณาต้นทุนต่อการโต้ตอบควบคู่กับคุณภาพของผลลัพธ์จากการประเมิน เพื่อตรวจสอบว่าคำตอบที่มีต้นทุนต่ำลงยังคงมีประโยชน์หรือไม่

3. ตัวเลขหลักอาจกำลังซ่อนอะไรอยู่

พิจารณาตัวชี้วัดทั้งสองจากผู้ใช้ กลุ่มงาน และช่วงเวลาเดียวกัน แล้วดูว่ามีกลุ่มใดที่ได้รับผลลัพธ์แย่ลงหรือไม่ นอกจากนี้ ควรคำนึงถึงสถานการณ์ก่อนเริ่มใช้งานด้วย เช่น ความพึงพอใจที่ต่ำอาจเกิดจากความไม่พอใจที่มีอยู่ก่อนลูกค้าจะติดต่อฝ่ายบริการ

4. อะไรคือเงื่อนไขที่จะทำให้เราต้องดำเนินการ และใครเป็นผู้รับผิดชอบ

กำหนดเกณฑ์ให้ชัดเจนว่าทีมต้องดำเนินการเมื่อใด เช่น เมื่อตัวชี้วัดด้านใดด้านหนึ่งเกินระดับที่ยอมรับได้ เมื่อด้านหนึ่งดีขึ้นแต่อีกด้านแย่ลง หรือเมื่อทั้งสองด้านแย่ลง พร้อมตกลงว่าใครจะเป็นผู้ตรวจสอบ จะตรวจสอบอะไรเป็นอันดับแรก และต้องรายงานผลกลับเมื่อใด

5. คู่ตัวชี้วัดนี้ยังเหมาะสมกับผลิตภัณฑ์ในระยะปัจจุบันหรือไม่

พิจารณาว่าควรใช้ตัวชี้วัดคู่นี้ต่อ เปลี่ยนเป็นคู่อื่น หรือเลิกใช้ ในช่วงทดลอง ทีมอาจมุ่งเน้นความน่าเชื่อถือในการทำงานและความมั่นใจของผู้ใช้ ส่วนเมื่อเปิดให้บริการจริง อาจต้องติดตามต้นทุนและคุณภาพอย่างใกล้ชิดมากขึ้น พร้อมกำหนดวันที่จะกลับมาทบทวนการตัดสินใจนี้อีกครั้ง

การวัดผลผลิตภัณฑ์ AI ไม่ควรเพียงบอกว่าผลิตภัณฑ์ทำงานได้ดีเพียงใด แต่ควรช่วยให้เห็นผลได้ผลเสียที่องค์กรต้องแลกกัน และทำให้ตัดสินใจในขั้นต่อไปได้ชัดเจนขึ้น

ผู้เขียน

Ale ZacariasและJosie Steer