لا تؤدي إضافة المقاييس بالضرورة إلى تحسين الفهم. تتضمن لوحات معلومات كثيرة عدة مقاييس للسلوك الأساسي نفسه. تصبح المقاييس أقدر على التشخيص عند جمعها في أزواج متعارضة: التكلفة مع الجودة، والاحتواء مع انطباع العملاء، والدقة مع زمن الاستجابة.
تتغير الأزواج المناسبة مع انتقال منتج الذكاء الاصطناعي من المرحلة التجريبية إلى الإنتاج. ينبغي أن يتبع القياس القرارات التي يحتاج الفريق إلى اتخاذها في كل مرحلة.
تخدم المراقبة التشغيلية والقياس الاستراتيجي غرضين مختلفين. قد تتابع الفرق مئات من إشارات النظام، بينما لا تستخدم لتوجيه قرارات المنتج سوى بضعة أزواج.
قد تروي المقاييس الرئيسية قصة مقنعة، لكنها تترك قرارًا مهمًا بشأن المنتج بلا حسم.
ارتبط مساعد Klarna المدعوم بالذكاء الاصطناعي علنًا بزيادة الإنتاجية وخفض التكاليف وتحقيق درجات لرضا العملاء مماثلة لما يحققه الوكلاء البشريون. في العام التالي، قررت الشركة توسيع إتاحة الدعم البشري، وأقر رئيسها التنفيذي بأن خفض التكلفة حظي باهتمام مفرط.
لم يكن ذلك رفضًا لمساعد الذكاء الاصطناعي أو للتقنية التي يقوم عليها. بل كان تعديلًا للتوازن بين الأتمتة والخدمة البشرية، استنادًا إلى ما تعلّمته الشركة من تشغيل المنتج. ومع تولّي الأتمتة عددًا أكبر من الاستفسارات البسيطة وعالية الحجم، أصبحت Klarna بحاجة إلى موظفين بشريين مؤهلين للتعامل مع الحالات المعقدة والحساسة.
بعد أن تحدد المؤسسات منذ البداية ما ينبغي لمنتجها تحقيقه، ستواجه معظم المؤسسات التي تطور منتجات الذكاء الاصطناعي السؤال نفسه في النهاية: هل ينجح فعلًا؟
إذا لم تكن الإجابة واضحة، فعادة ما يكون الميل التلقائي إلى إضافة المزيد من المقاييس. تصبح الثلاثة 10، ثم تصبح العشرة 30. تزداد لوحة المعلومات ثراءً، لكن فهم الفريق قد لا يتحسن.
لا تكمن المشكلة دائمًا في جودة كل مقياس على حدة، بل في العلاقة بين المقاييس. يمكن لرضا العملاء وصافي نقاط الترويج والتقييمات ونسب الإعجاب أن توفر جميعًا إشارات مفيدة، لكنها قد تعكس تغيرات متشابهة في الانطباع العام. عندما تتحرك معًا، فإنها تؤكد وقوع أمر ما من دون أن تفسر بالضرورة سببه.
لذلك، ينبغي لفرق الذكاء الاصطناعي ألا تكتفي بالمقاييس المتوافقة، بل أن تحدد مقاييس تكشف النتائج المتعارضة. تكشف هذه الأزواج المتعارضة أثر المفاضلات الكامنة وراء أداء المنتج وتساعد على مراقبته، ما يتيح اتخاذ قرارات أفضل.
في أحد تطبيقات ما قبل الإطلاق، كان الفريق المشترك يطور وكيلًا صوتيًا فوريًا مدعومًا بالذكاء الاصطناعي لمكالمات دعم العملاء الواردة. لم يكن أحد أصعب الأسئلة متعلقًا باختيار النموذج أو تنسيق عمل المكونات. بل كان كيف ستعرف المؤسسة ما إذا كان المنتج ناجحًا بعد أن يبدأ العملاء باستخدامه على نطاق واسع.
استخدم الإطار الأولي ثلاثة مقاييس:
معدل الاحتواء: عدد المرات التي يحل فيها الذكاء الاصطناعي مشكلة المتصل من دون تحويل المكالمة إلى شخص.
معدل التصعيد: عدد المرات التي تُحوَّل فيها المكالمة إلى وكيل بشري.
معدل الإنجاز: عدد المرات التي تُحل فيها مشكلة العميل في نهاية المطاف.
كان كل مقياس منطقيًا. لكنها مجتمعة لم تستطع الإجابة عن سؤال بديهي: إذا ارتفع التصعيد، فماذا يخبرنا ذلك؟
قسّم الفريق التصعيد إلى ثمانية أنواع فرعية. ثم أضاف مقاييس التخلي ومسار العميل والتوقيت، ودرجات فهم اللغة، والإنجاز بحسب نوع الاستفسار. ضم الإطار في النهاية 31 مقياسًا موزعة على ست فئات.
استطاع وصف التصعيد بالتفصيل، لكنه ظل عاجزًا عن تشخيص سببه بصورة موثوقة. كانت معظم المقاييس تنويعات للسلوك نفسه، لذا تحركت معًا بدلًا من اختبار تفسيرات متنافسة.
أصبحت لوحة المعلومات رصدية بدلًا من أن تكون تشخيصية.
لم يكن الفريق بحاجة إلى مستوى آخر من التفصيل. بل كان بحاجة إلى مقاييس يقيّد بعضها بعضًا.
نسمي هذه الأزواج المتعارضة: مقياسان قد يؤدي تحسين أحدهما بمعزل عن الآخر إلى الإضرار بالنتيجة التي يمثلها الثاني. يصف الاسم نمط الإخفاق الناتج عن التحسين الأحادي، لا الحالة المنشودة.
عندما يظل الجانبان في وضع جيد، فقد يكون المنتج يعمل على نحو مستدام. وعندما يتباعدان، يساعد اتجاه هذا التباعد الفريق على تحديد ما ينبغي تقصّيه.
ما كان لدينا | الزوج المتعارض | ما قد يكشفه الزوج |
|---|---|---|
معدل التصعيد مقسّم إلى ثمانية أنواع فرعية | معدل التصعيد ↔ الوقت حتى التصعيد | قد يشير التصعيد الفوري إلى مشكلة في الثقة أو صياغة التجربة؛ وقد يشير التصعيد المتأخر إلى عجز النظام عن إكمال المهمة. |
الإبلاغ عن معدل الاحتواء ومعدل الإنجاز كلٌّ على حدة | معدل الاحتواء ↔ انطباع العميل | ما إذا كان الاحتواء يمثل حلًا مُرضيًا أم تخلي العميل عن المحاولة. |
معدل الإنجاز بحسب نوع القصد | معدل الإنجاز ↔ عمق المحادثة | ما إذا كان الحل الناجح فعّالًا أم يتطلب تفاعلًا مُرهقًا. |
لنتعمق في كيفية كشف ذلك وما ينبغي فعله بهذه الرؤية، ولننظر في معدل التصعيد والوقت حتى التصعيد. لن يعرف الفريق كيف يتصرف العملاء حتى تبدأ المكالمات الفعلية، لكنه يستطيع تحديد الفرضيات المطلوب اختبارها.
إذا بدأ تصعيد المزيد من المكالمات وغادر العملاء تجربة الذكاء الاصطناعي خلال أول 30 ثانية، فعلى الفريق تقصي الثقة والإفصاح والنبرة والتفاعلات الافتتاحية. إذا صعّد العملاء بعد قضاء عدة دقائق في محاولة تنفيذ مهمة، فالأرجح أن المشكلة في القدرات أو تغطية سير العمل.
يظل الرقم الرئيسي للتصعيد واحدًا. لكن قرار المنتج يختلف.
لا يثبت الزوج المفيد السبب بمفرده. بل يضيّق نطاق التحقيق ويوضح القرار التالي.
يوضح مثال Klarna السابق كيفية تطبيق هذا المبدأ عند تفاعل التكلفة وجودة الخدمة. ويبيّن كيف يمكن لنموذج تشغيل مدعوم بالذكاء الاصطناعي أن يتطور بينما تراقب الشركة أثر المفاضلات وتتعلم من تطبيقه.
في فبراير 2024، أفادت الشركة بأن مساعدها المدعوم بالذكاء الاصطناعي أدار 2.3 مليون محادثة في شهره الأول، وأنجز عملًا يعادل عمل 700 وكيل بدوام كامل، وحقق درجات لرضا العملاء مماثلة لما يحققه الوكلاء البشريون. قدّرت Klarna أن المساعد سيسهم في تحسين الأرباح بمقدار 40 مليون دولار خلال 2024. وهذه نتائج أعلنتها Klarna نفسها وليست تقييمًا مستقلًا.
في مايو 2025، قال الرئيس التنفيذي لـKlarna إن الشركة بالغت في التركيز على خفض تكاليف خدمة العملاء، ووصف خططًا لتوسيع إتاحة الدعم البشري. مثّل ذلك تعديلًا للتوازن بين الخدمة المؤتمتة والبشرية، لا رفضًا للمساعد المدعوم بالذكاء الاصطناعي أو للتقنية التي يقوم عليها.
توضح الأدلة المنشورة ضرورة مراعاة مقاييس الكفاءة إلى جانب احتياجات مختلف العملاء والتفاعلات. قد يحقق نظام ذكاء اصطناعي أداءً جيدًا في المتوسط، بينما تظل بعض الحالات المعقدة أو الحساسة أو غير المعتادة بحاجة إلى قناة بشرية يسهل الوصول إليها.
تساعد مراقبة جانبي هذه العلاقة الشركة على تحديد مواضع خلق الأتمتة للقيمة، ومواضع بقاء الدعم البشري مهمًا، وكيف ينبغي تعديل التوازن مع ظهور أدلة جديدة.
قد تشمل الأزواج المتعارضة الأخرى في منتجات الذكاء الاصطناعي:
الزوج المتعارض | الخطر الذي يساعد على كشفه |
|---|---|
دقة الاستجابة ↔ زمن الاستجابة | نظام دقيق تقنيًا، لكنه أبطأ من أن يلائم سير العمل. |
إكمال المهمة ↔ معدل تدخل المستخدم لتجاوز قرارات النظام | سير عمل بالذكاء الاصطناعي يكمل مهام يعيد المستخدمون تنفيذها مرارًا. |
التكلفة لكل تفاعل ↔ جودة المخرجات المقيّمة | وفورات تتحقق على حساب تجربة العميل أو الموظف. |
التبني ↔ الوقت اللازم لتحقيق القيمة | نمو التسجيلات من دون قيمة مقابلة للمستخدم. |
ليس الهدف زيادة كلا المقياسين إلى ما لا نهاية. بل إظهار المفاضلة قبل أن يؤدي التحسين الأحادي إلى مشكلة تشغيلية.
ظهر تحدٍّ ذو صلة في تطبيق لدعم لاعبي إحدى شركات ألعاب الهاتف المحمول. تعامل النظام مع أعداد كبيرة من المشكلات، مثل فقدان التقدم والنزاعات المتعلقة بالدفع والوصول إلى الحساب.
كانت مقاييس الكفاءة مهمة لأن النظام يعمل على نطاق واسع. لكن دعم اللاعبين ليس مجرد قائمة انتظار تشغيلية. غالبًا ما يصل اللاعبون وهم محبطون لأن خللًا وقع بالفعل في موضع آخر من تجربتهم.
تغيّر نقطة البداية هذه كيفية تفسير بيانات رضا العملاء. قد يظل اللاعب الذي حُلّت مشكلته بصورة صحيحة يعبّر عن رضا منخفض لأنه فقد تقدمه أصلًا. قد تؤدي قراءة هذه الدرجة بلا سياق إلى تحميل تفاعل الدعم مسؤولية إحباط نشأ في مرحلة سابقة من رحلة العميل.
لذلك احتاج الفريق إلى التمييز بين انطباع العميل عند البداية وأثر تجربة الدعم. لم يكن السؤال الأكثر فائدة: «هل كان اللاعب سعيدًا؟» بل كان: «هل حسّن التفاعل الوضع مقارنة بنقطة بداية اللاعب؟»
يمكن لهذه المقارنة أن تساعد على فصل الإحباط من المنتج عن جودة الدعم، شريطة أن يمتلك الفريق وسيلة موثوقة لقياس كليهما.
تتغير منتجات الذكاء الاصطناعي، لكن مقاييسها غالبًا ما تظل ثابتة.
خلال المرحلة التجريبية، قد يكون السؤال المحوري هو ما إذا كان النظام جديرًا بالثقة بما يكفي لتبرير استمرار الاستثمار:
هل يكمل المهمة الأساسية بصورة موثوقة؟
هل يثق به المستخدمون بما يكفي للاستمرار؟
كيف يتصرف خارج السيناريوهات الأكثر شيوعًا؟
هل يمكن تحديد الإخفاقات والتعافي منها بأمان؟
تجعل هذه الأسئلة الأولوية لأزواج مثل:
نجاح المهمة الأساسية ↔ الأداء في الحالات النادرة؛
معدل الأتمتة ↔ معدل التدخل البشري لتجاوز قرارات النظام؛ و
سرعة الإكمال ↔ ثقة المستخدم.
عندما يصبح المنتج مهمًا تشغيليًا، تتغير الأسئلة:
هل يمكنه التوسع من دون خفض الجودة؟
هل تتحسن جدواه الاقتصادية مع الاستخدام؟
هل يظل الأداء مستقرًا مع نمو التبني؟
هل تحدث التدخلات البشرية في المواضع المناسبة؟
قد تتحول الأزواج المقابلة إلى:
التكلفة لكل تفاعل ↔ جودة المخرجات المقيّمة؛
نطاق التبني ↔ عمق الاستخدام؛ و
معدل الأتمتة ↔ التعرض للمخاطر التشغيلية.
ليست المقاييس المبكرة خاطئة بالضرورة. فهي تجيب عن الأسئلة التي كانت مهمة في مرحلة سابقة.
ينشأ الخطر خلال الانتقال. غالبًا ما تستمر مقاييس المرحلة التجريبية لأن الفرق تعرف كيفية إعداد تقاريرها، ولأن أحدًا لا يتولى قرار إيقافها. قد تتحول المقاييس التي دعمت التعلم سابقًا تدريجيًا إلى مقاييس شكلية.
لذلك ينبغي أن تكون للأزواج دورة حياة. ينبغي للفرق اعتمادها لخدمة قرار محدد، ومراجعة مدى استمرارها في كشف مفاضلة جوهرية، ثم إيقافها عندما يتغير المنتج أو القرار.
تتطلب أنظمة الذكاء الاصطناعي قابلية رصد تفصيلية وتنبيهات وضمانًا للجودة وتقييمًا. إزالة هذه الإشارات ستجعل تشغيل المنتج بأمان أكثر صعوبة. لكن المراقبة التشغيلية ليست هي نفسها القياس الذي تعتمد عليه القيادة.
تساعد المراقبة الفرق على اكتشاف الحوادث وتتبع الإخفاقات وفهم سلوك النظام. تساعد مقاييس القرار قادة المنتج والأعمال على تحديد ما إذا كانوا سيستثمرون أو يتدخلون أو يغيرون الاتجاه أو يقبلون مفاضلة ما.
قد تراقب المؤسسة مئات الإشارات التقنية والتشغيلية، بينما تبرز زوجين أو ثلاثة فقط من الأزواج المتعارضة لاتخاذ قرار معين بشأن المنتج. يسهّل إبقاء مستوى القرار محدودًا ترتيب الأولويات.
يعتمد تواتر المراجعة المناسب على المنتج. قد يحتاج النظام الجديد أو سريع التغير إلى مراجعات أسبوعية للقرارات، بينما قد يناسب المنتج الناضج جدول شهري أو ربع سنوي. المبدأ أهم من الفاصل الزمني: راجع الزوج بوتيرة تكفي للتحرك قبل أن تصبح المفاضلة مكلفة أو غير آمنة.
لا يصبح الزوج مفيدًا إلا عندما تتفق المؤسسة على ما سيحدث إذا تدهور.
ويتطلب ذلك أكثر من تحديد خط أحمر للتباعد. ينبغي للفرق مراعاة ثلاثة أوضاع:
الإخفاق المطلق: يتجاوز أحد المقياسين حدًا غير مقبول، بصرف النظر عن الآخر.
التباعد: يتحسن أحد المقياسين بينما يتدهور المقياس الموازن له.
التدهور المشترك: يتراجع الجانبان، ما يشير إلى مشكلة أوسع في المنتج أو التشغيل.
ينبغي أن يكون لكل زوج:
مسؤول محدد بالاسم؛
قرار واضح يدعمه؛
حدود أو معايير تقييم متفق عليها؛
مسار للتحقيق؛ و
مجموعة من التدخلات الممكنة.
من دون هذه العناصر، ترصد المؤسسة المنتج بدلًا من إدارته.
قبل إضافة مقياس آخر، اختر قرارًا مهمًا بشأن المنتج وأجب عن هذه الأسئلة. دوّن الإجابات حتى تنتهي المراجعة بخطوة تالية متفق عليها.
1. ما القرار الذي نحتاج إلى مساعدة هذه المقاييس في اتخاذه؟
كن محددًا: هل نقرر توسيع الأتمتة أم تغيير نموذج أم تحسين التحويل إلى موظف بشري؟ حدّد القرار قبل اختيار المقاييس.
2. إذا تحسن هذا الرقم، فما الذي قد يسوء؟
حدّد النتيجة التي تحتاج إلى حمايتها ومقياسًا يكشف الضرر. على سبيل المثال، اقرن تكلفة كل تفاعل بجودة المخرجات المقيّمة للتحقق من أن الإجابات الأرخص لا تزال مفيدة.
3. ما الذي قد تخفيه الأرقام الرئيسية؟
اقرأ المقياسين للمستخدمين والمهام والفترة الزمنية نفسها، ثم ابحث عن الفئات التي تواجه نتائج أسوأ. راعِ أيضًا الظروف الأولية: فقد يعكس انخفاض الرضا إحباطًا سبق تفاعل الدعم.
4. ما الذي سيدفعنا إلى التحرك، ومن المسؤول عن الاستجابة؟
ضع معايير للتحرك عندما يتجاوز مقياس حدًا غير مقبول، أو يتحسن أحدهما ويسوء الآخر، أو يتدهور كلاهما. واتفق على من سيحقق، وما الذي سيفحصه أولًا، ومتى سيقدم تقريره.
5. هل لا يزال هذا الزوج ملائمًا للمرحلة الحالية من المنتج؟
قرر ما إذا كنت ستحتفظ به أو تستبدله أو توقفه. قد تركز المرحلة التجريبية على موثوقية المهمة وثقة المستخدم؛ أما الخدمة العاملة فقد تحتاج إلى تدقيق أكبر في التكلفة والجودة. حدّد موعدًا لإعادة النظر في الاختيار.
ينبغي لقياس منتجات الذكاء الاصطناعي أن يتجاوز وصف الأداء. بل ينبغي أن يكشف المفاضلات التي تجريها المؤسسة وأن يوضح القرار التالي.