افزودن سنجهها لزوماً درک را بهبود نمیدهد. بسیاری از داشبوردها چند سنجه از یک رفتار زیربنایی واحد دارند. سنجهها وقتی در قالب جفتهای متقابلاً مخرب ترکیب شوند، قدرت تشخیصی بیشتری دارند: هزینه در برابر کیفیت، مهار در برابر نگرش مشتری، یا دقت در برابر تأخیر.
با گذار محصول هوش مصنوعی از مرحله آزمایشی به تولید، جفتهای مناسب نیز تغییر میکنند. سنجش باید تابع تصمیمهایی باشد که تیم در هر مرحله باید بگیرد.
پایش عملیاتی و سنجش راهبردی اهداف متفاوتی دارند. تیمها ممکن است صدها سیگنال سیستم را رصد کنند، اما برای هدایت تصمیمهای محصول فقط از چند جفت استفاده کنند.
سنجههای اصلی میتوانند روایتی متقاعدکننده بسازند، اما یک تصمیم مهم محصول را همچنان بیپاسخ بگذارند.
دستیار هوش مصنوعی Klarna در گزارشهای عمومی با توان عملیاتی بیشتر، هزینه کمتر و امتیازهای رضایت مشتری همتراز با عاملهای انسانی مرتبط دانسته شد. سال بعد، شرکت تصمیم گرفت دسترسی به پشتیبانی انسانی را افزایش دهد و مدیرعامل آن اذعان کرد که بیش از حد بر کاهش هزینه تأکید شده بود.
این تصمیم به معنای رد دستیار هوش مصنوعی یا فناوری زیربنایی آن نبود. شرکت با آموختن از بهره برداری محصول، توازن میان خودکار سازی و خدمات انسانی را تنظیم کرد. با رسیدگی خودکار سازی به بخش بیشتری از درخواستهای پر تعداد و سادهتر، نمایندگان انسانی مورد نیاز Klarna کسانی بودند که برای رسیدگی به موارد پیچیده و حساس مجهز بودند.
پس از آنکه از ابتدا مشخص شد محصول باید به چه هدفی برسد، بیشتر سازمانهای سازنده محصولات هوش مصنوعی سرانجام با یک پرسش روبهرو میشوند: آیا واقعاً کار میکند؟
اگر پاسخ روشن نباشد، واکنش غریزی معمولاً افزودن سنجههای بیشتر است. سه سنجه به ۱۰ و سپس ۱۰ سنجه به ۳۰ تبدیل میشود. داشبورد پربارتر میشود، اما شاید درک تیم بهتر نشود.
مشکل همیشه کیفیت تکتک سنجهها نیست، بلکه گاهی رابطه میان آنهاست. رضایت مشتری، شاخص خالص ترویجکنندگان، دیدگاهها و نرخ پسند همگی سیگنالهای مفیدی هستند، اما ممکن است تغییرات مشابهی را در نگرش کلی بازتاب دهند. وقتی همجهت تغییر میکنند، وقوع یک رویداد را تأیید میکنند، بیآنکه لزوماً علتش را توضیح دهند.
بنابراین، تیمهای هوش مصنوعی باید فراتر از سنجههای همسو بروند و سنجههایی را بیابند که نتایج رقیب را آشکار میکنند. این جفتهای متقابلاً مخرب، اثر مصالحههای نهفته در عملکرد محصول را آشکار و قابل پایش میکنند و به تصمیمگیری بهتر میانجامند.
در یکی از استقرارهای پیش از عرضه، تیم مشترک در حال توسعه یک عامل صوتی هوش مصنوعی بلادرنگ برای تماسهای ورودی پشتیبانی مشتری بود. یکی از دشوارترین پرسشها درباره انتخاب مدل یا هماهنگسازی اجزا نبود. پرسش این بود که سازمان پس از استفاده گسترده مشتریان، چگونه تشخیص دهد محصول کار میکند یا نه.
چارچوب اولیه سه سنجه داشت:
نرخ مهار: هوش مصنوعی چند بار تماس را بدون انتقال به یک فرد حل میکند.
نرخ ارجاع: تماس چند بار به یک عامل انسانی منتقل میشود.
نرخ حل مسئله: مشکل مشتری در نهایت چند بار حل میشود.
هر سنجه بهتنهایی منطقی بود. اما این سنجهها در کنار هم نمیتوانستند به پرسشی روشن پاسخ دهند: افزایش ارجاع چه چیزی به ما میگوید؟
تیم ارجاع را به هشت زیرنوع تفکیک کرد. سپس سنجههای انصراف، مسیر و زمانبندی، امتیازهای درک زبان و نرخ حل مسئله بر اساس نوع درخواست را افزود. این چارچوب در نهایت شامل ۳۱ سنجه در شش دسته شد.
میتوانست ارجاع را با جزئیات توصیف کند، اما هنوز قادر نبود علت آن را با اطمینان تشخیص دهد. بیشتر سنجهها گونههایی از یک رفتار واحد بودند؛ بنابراین بهجای آزمودن توضیحات رقیب، همجهت تغییر میکردند.
داشبورد بهجای ابزاری تشخیصی، صرفاً مشاهدهگر شده بود.
آنچه تیم نیاز داشت، لایه دیگری از تفکیک نبود. تیم به سنجههایی نیاز داشت که یکدیگر را مهار کنند.
ما به اینها جفتهای متقابلاً مخرب میگوییم: دو سنجه که بهبود جداگانه یکی از آنها میتواند به نتیجهای که دیگری نشان میدهد آسیب بزند. این نام حالت شکست ناشی از بهینهسازی یکجانبه را توصیف میکند، نه وضعیت مطلوب را.
وقتی هر دو سوی جفت در وضعیت مطلوب بمانند، محصول احتمالاً بهشکلی پایدار عمل میکند. وقتی از هم فاصله میگیرند، جهت این واگرایی به تیم کمک میکند محل بررسی را تعیین کند.
آنچه داشتیم | جفت متقابلاً مخرب | آنچه این جفت ممکن است آشکار کند |
|---|---|---|
نرخ ارجاع، تفکیکشده به هشت زیرنوع | نرخ ارجاع ↔ زمان تا ارجاع | ارجاع فوری ممکن است نشانه مشکل در اعتماد یا نحوه طرح موضوع باشد؛ ارجاع دیرتر شاید نشان دهد سیستم قادر به تکمیل کار نیست. |
گزارش جداگانه نرخ مهار و نرخ حل مسئله | نرخ مهار ↔ نگرش مشتری | اینکه مهار نشاندهنده حل رضایتبخش مسئله است یا انصراف مشتری از تلاش. |
نرخ حل مسئله بر اساس نوع هدف | نرخ حل مسئله ↔ عمق مکالمه | اینکه حل موفق مسئله کارآمد است یا به تعاملی فرساینده نیاز دارد. |
برای بررسی دقیقتر چگونگی آشکار شدن این موضوع و نحوه استفاده از این بینش، نرخ ارجاع و زمان تا ارجاع را در نظر بگیریم. تیم تا زمان دریافت تماسهای واقعی نمیداند مشتریان چگونه رفتار میکنند، اما میتواند فرضیههای لازم برای آزمون را تعریف کند.
اگر تماسهای بیشتری ارجاع شوند و مشتریان در ۳۰ ثانیه نخست تجربه هوش مصنوعی را ترک کنند، تیم باید اعتماد، شفافسازی، لحن و تعاملات آغازین را بررسی کند. اگر مشتریان پس از چند دقیقه تلاش برای انجام کار درخواست ارجاع دهند، احتمالاً مشکل از توانمندی یا پوشش گردشکار است.
عدد اصلی ارجاع یکسان است. اما تصمیم محصول متفاوت است.
یک جفت مفید بهتنهایی علت را اثبات نمیکند. اما دامنه بررسی را محدود و تصمیم بعدی را روشنتر میکند.
نمونه Klarna که پیشتر مطرح شد، کاربرد این اصل را هنگام تعامل هزینه و کیفیت خدمات نشان میدهد. این نمونه نشان میدهد الگوی عملیاتی مبتنی بر هوش مصنوعی چگونه با پایش اثر مصالحهها و یادگیری از استقرار تکامل مییابد.
شرکت در فوریه ۲۰۲۴ گزارش کرد که دستیار هوش مصنوعی آن در ماه نخست ۲٫۳ میلیون مکالمه را مدیریت کرده، معادل کار ۷۰۰ عامل تماموقت را انجام داده و به امتیازهای رضایت مشتری همتراز با عاملهای انسانی رسیده است. Klarna برآورد کرد این دستیار در سال ۲۰۲۴ باعث ۴۰ میلیون دلار بهبود سود خواهد شد. اینها نتایج گزارششده خود Klarna بودند، نه ارزیابی مستقل.
در مه ۲۰۲۵، مدیرعامل Klarna گفت شرکت در خدمات مشتری بیش از حد بر کاهش هزینه تأکید کرده و از برنامه افزایش دسترسی به پشتیبانی انسانی خبر داد. این تصمیم به معنای تنظیم توازن میان خدمات خودکار و انسانی بود، نه رد دستیار هوش مصنوعی یا فناوری زیربنایی آن.
شواهد عمومی نشان میدهند چرا سنجههای کارایی باید در کنار نیازهای مشتریان و تعاملات گوناگون بررسی شوند. ممکن است یک سیستم هوش مصنوعی در مجموع خوب عمل کند، اما برخی موارد پیچیده، حساس یا نامعمول همچنان از دسترسی آسان به پشتیبانی انسانی بهره ببرند.
پایش هر دو سوی این رابطه به شرکت کمک میکند تعیین کند خودکارسازی کجا ارزش میآفریند، پشتیبانی انسانی کجا همچنان مهم است و با ظهور شواهد جدید این توازن چگونه باید تغییر کند.
دیگر جفتهای متقابلاً مخرب در محصولات هوش مصنوعی ممکن است شامل این موارد باشند:
جفت متقابلاً مخرب | ریسکی که به آشکار شدن آن کمک میکند |
|---|---|
دقت پاسخ ↔ تأخیر پاسخ | سیستمی که از نظر فنی دقیق است، اما برای گردشکار بیش از حد کند عمل میکند. |
تکمیل وظیفه ↔ نرخ بازانجام کار توسط کاربر | گردشکار هوش مصنوعی که وظایفی را تکمیل میکند که کاربران بارها از نو انجام میدهند. |
هزینه هر تعامل ↔ کیفیت ارزیابیشده خروجی | صرفهجویی حاصل از تضعیف تجربه مشتری یا کارمند. |
پذیرش ↔ زمان دستیابی به ارزش | رشد ثبتنام بدون ایجاد ارزش متناظر برای کاربر. |
هدف این نیست که هر دو سنجه تا ابد افزایش یابند. هدف این است که مصالحه پیش از آنکه بهینهسازی یکجانبه مشکلی عملیاتی ایجاد کند، آشکار شود.
چالشی مشابه در استقرار سامانه پشتیبانی از بازیکنان برای یک شرکت بازیهای موبایلی پدید آمد. سیستم مشکلات پرتکراری مانند از دست رفتن پیشرفت بازی، اختلافهای پرداخت و دسترسی به حساب را مدیریت میکرد.
سنجههای کارایی مهم بودند، زیرا سیستم در مقیاس گسترده کار میکرد. اما پشتیبانی بازیکنان صرفاً یک صف عملیاتی نیست. بازیکنان اغلب سرخورده مراجعه میکنند، زیرا پیشتر در بخش دیگری از تجربهشان مشکلی رخ داده است.
این نقطه شروع، نحوه تفسیر دادههای رضایت مشتری را تغییر میدهد. بازیکنی که مشکلش بهدرستی حل شده شاید همچنان رضایت کمی گزارش کند، چون در ابتدا پیشرفت خود را از دست داده است. تفسیر این امتیاز بدون توجه به زمینه، ممکن است تعامل پشتیبانی را بابت سرخوردگی ایجادشده در مراحل پیشین مسیر مشتری جریمه کند.
بنابراین، تیم باید نگرش اولیه مشتری را از اثر تجربه پشتیبانی تفکیک میکرد. پرسش مفیدتر این نبود: «آیا بازیکن راضی بود؟» بلکه این بود: «آیا تعامل، وضعیت را نسبت به نقطه شروع بازیکن بهتر کرد؟»
بهشرط وجود روشی قابلاعتماد برای سنجش هر دو، این مقایسه میتواند سرخوردگی ناشی از محصول را از کیفیت پشتیبانی تفکیک کند.
محصولات هوش مصنوعی تغییر میکنند، اما سنجههایشان اغلب ثابت میمانند.
در مرحله آزمایشی، پرسش اصلی شاید این باشد که آیا سیستم برای توجیه ادامه سرمایهگذاری بهاندازه کافی قابلاعتماد است:
آیا وظیفه اصلی را با اطمینان تکمیل میکند؟
آیا کاربران آنقدر به آن اعتماد دارند که ادامه دهند؟
خارج از رایجترین سناریوها چگونه رفتار میکند؟
آیا میتوان شکستها را شناسایی و بهشکلی ایمن بازیابی کرد؟
این پرسشها جفتهایی مانند موارد زیر را مناسبتر میکنند:
موفقیت در وظیفه اصلی ↔ عملکرد در موارد خاص؛
نرخ خودکارسازی ↔ نرخ مداخله انسانی؛ و
سرعت تکمیل ↔ اطمینان کاربر.
وقتی محصول از نظر عملیاتی مهم میشود، پرسشها تغییر میکنند:
آیا میتواند بدون کاهش کیفیت مقیاسپذیر شود؟
آیا صرفه اقتصادی آن با افزایش استفاده بهتر میشود؟
آیا با افزایش پذیرش، عملکرد پایدار میماند؟
آیا مداخلات انسانی در موقعیتهای مناسب رخ میدهند؟
جفتهای مربوط ممکن است به این موارد تغییر کنند:
هزینه هر تعامل ↔ کیفیت ارزیابیشده خروجی؛
گستره پذیرش ↔ عمق استفاده؛ و
نرخ خودکارسازی ↔ میزان مواجهه با ریسک عملیاتی.
سنجههای اولیه لزوماً اشتباه نیستند. آنها به پرسشهای مهم مرحلهای پیشین پاسخ میدهند.
خطر هنگام گذار پدید میآید. سنجههای مرحله آزمایشی اغلب باقی میمانند، زیرا تیمها شیوه گزارش آنها را میدانند و هیچکس مسئول تصمیمگیری درباره کنار گذاشتنشان نیست. سنجههایی که زمانی به یادگیری کمک میکردند، ممکن است بهتدریج به سنجههای نمایشی تبدیل شوند.
بنابراین، جفتها باید چرخه عمر داشته باشند. تیمها باید آنها را برای تصمیمی مشخص معرفی کنند، بررسی کنند که آیا هنوز مصالحهای مهم را آشکار میکنند و با تغییر محصول یا تصمیم، کنارشان بگذارند.
سیستمهای هوش مصنوعی به مشاهدهپذیری دقیق، هشداردهی، تضمین کیفیت و ارزیابی نیاز دارند. حذف این سیگنالها بهرهبرداری ایمن از محصول را دشوارتر میکند. اما پایش عملیاتی با سنجش مدیریتی یکسان نیست.
پایش به تیمها کمک میکند رخدادها را شناسایی، شکستها را ریشهیابی و رفتار سیستم را درک کنند. سنجههای تصمیمگیری به رهبران محصول و کسبوکار کمک میکنند درباره سرمایهگذاری، مداخله، تغییر مسیر یا پذیرش یک مصالحه تصمیم بگیرند.
ممکن است سازمانی صدها سیگنال فنی و عملیاتی را پایش کند، اما برای یک تصمیم خاص محصول فقط دو یا سه جفت متقابلاً مخرب را در سطح تصمیمگیری مطرح سازد. کوچک نگهداشتن این لایه تصمیمگیری، اولویتبندی را آسانتر میکند.
تناوب مناسب بازبینی به محصول بستگی دارد. یک سیستم جدید یا بهسرعت در حال تغییر شاید به بازبینی هفتگی تصمیمها نیاز داشته باشد، اما برای محصولی بالغ، بازبینی ماهانه یا فصلی کافی است. اصل موضوع مهمتر از فاصله زمانی است: جفت را آنقدر منظم بازبینی کنید که پیش از پرهزینه یا ناایمن شدن مصالحه بتوان اقدام کرد.
یک جفت تنها زمانی مفید میشود که سازمان توافق کند در صورت افت آن چه اتفاقی بیفتد.
این کار به چیزی بیش از تعیین مرز قرمز برای واگرایی نیاز دارد. تیمها باید سه وضعیت را در نظر بگیرند:
شکست مطلق: یکی از سنجهها، مستقل از دیگری، از آستانهای غیرقابلقبول عبور میکند.
واگرایی: یک سنجه بهبود مییابد و سنجه متعادلکننده آن افت میکند.
افت همزمان: هر دو سو افت میکنند که نشاندهنده مشکلی گستردهتر در محصول یا عملیات است.
هر جفت باید این موارد را داشته باشد:
یک مسئول مشخص؛
تصمیم روشنی که از آن پشتیبانی میکند؛
آستانهها یا معیارهای ارزیابی مورد توافق؛
یک مسیر بررسی؛ و
مجموعهای از مداخلات احتمالی.
بدون این عناصر، سازمان بهجای مدیریت محصول فقط آن را مشاهده میکند.
پیش از افزودن سنجهای دیگر، یک تصمیم مهم محصول را انتخاب کنید و به این پرسشها پاسخ دهید. پاسخها را بنویسید تا بازبینی با توافق درباره گام بعدی پایان یابد.
۱. این سنجهها باید در گرفتن کدام تصمیم به ما کمک کنند؟
دقیق باشید: آیا باید درباره گسترش خودکارسازی، تغییر مدل یا بهبود تحویل کار به انسان تصمیم بگیریم؟ پیش از انتخاب سنجهها، تصمیم را مشخص کنید.
۲. اگر این عدد بهتر شود، چه چیزی ممکن است بدتر شود؟
نتیجهای را که باید حفظ کنید و سنجهای را که آسیب را آشکار میکند، مشخص کنید. برای نمونه، هزینه هر تعامل را با کیفیت ارزیابیشده خروجی جفت کنید تا مشخص شود پاسخهای ارزانتر همچنان مفیدند یا نه.
۳. اعداد اصلی چه چیزی را ممکن است پنهان کنند؟
هر دو سنجه را برای کاربران، وظایف و بازه زمانی یکسان بررسی کنید و سپس گروههایی را بیابید که نتایج بدتری دارند. شرایط اولیه را نیز در نظر بگیرید: رضایت کم ممکن است بازتاب سرخوردگی پیش از تعامل با پشتیبانی باشد.
۴. چه چیزی ما را به اقدام وامیدارد و مسئول واکنش کیست؟
برای اقدام در سه حالت معیار تعیین کنید: عبور سنجهای از حد غیرقابلقبول، بهبود یکی و افت دیگری، یا افت هر دو. توافق کنید چه کسی بررسی کند، ابتدا چه چیزی را بسنجد و چه زمانی نتیجه را گزارش دهد.
۵. آیا این جفت هنوز با مرحله کنونی محصول متناسب است؟
تصمیم بگیرید آن را حفظ، جایگزین یا کنار بگذارید. یک طرح آزمایشی ممکن است بر قابلیت اطمینان وظیفه و اعتماد کاربر تمرکز کند؛ یک سرویس فعال شاید به بررسی دقیقتر هزینه و کیفیت نیاز داشته باشد. تاریخی برای بازنگری این انتخاب تعیین کنید.
سنجش محصول هوش مصنوعی باید فراتر از توصیف عملکرد باشد. باید مصالحههای سازمان را آشکار و تصمیم بعدی را روشنتر کند.