ناوبری اصلی

پایش اثر مصالحه‌ها هنگام ساخت محصولات هوش مصنوعی

آشکار کردن مصالحه‌های پنهان به تیم‌ها کمک می‌کند شکست محصولات هوش مصنوعی را تشخیص دهند و بهتر تصمیم بگیرند.

نکات کلیدی برای مدیران

  • افزودن سنجه‌ها لزوماً درک را بهبود نمی‌دهد. بسیاری از داشبوردها چند سنجه از یک رفتار زیربنایی واحد دارند. سنجه‌ها وقتی در قالب جفت‌های متقابلاً مخرب ترکیب شوند، قدرت تشخیصی بیشتری دارند: هزینه در برابر کیفیت، مهار در برابر نگرش مشتری، یا دقت در برابر تأخیر.

  • با گذار محصول هوش مصنوعی از مرحله آزمایشی به تولید، جفت‌های مناسب نیز تغییر می‌کنند. سنجش باید تابع تصمیم‌هایی باشد که تیم در هر مرحله باید بگیرد.

  • پایش عملیاتی و سنجش راهبردی اهداف متفاوتی دارند. تیم‌ها ممکن است صدها سیگنال سیستم را رصد کنند، اما برای هدایت تصمیم‌های محصول فقط از چند جفت استفاده کنند.

سنجه‌های اصلی می‌توانند روایتی متقاعدکننده بسازند، اما یک تصمیم مهم محصول را همچنان بی‌پاسخ بگذارند.

دستیار هوش مصنوعی Klarna در گزارش‌های عمومی با توان عملیاتی بیشتر، هزینه کمتر و امتیازهای رضایت مشتری هم‌تراز با عامل‌های انسانی مرتبط دانسته شد. سال بعد، شرکت تصمیم گرفت دسترسی به پشتیبانی انسانی را افزایش دهد و مدیرعامل آن اذعان کرد که بیش از حد بر کاهش هزینه تأکید شده بود.

این تصمیم به معنای رد دستیار هوش مصنوعی یا فناوری زیربنایی آن نبود. شرکت با آموختن از بهره برداری محصول، توازن میان خودکار سازی و خدمات انسانی را تنظیم کرد. با رسیدگی خودکار سازی به بخش بیشتری از درخواست‌های پر تعداد و ساده‌تر، نمایندگان انسانی مورد نیاز Klarna کسانی بودند که برای رسیدگی به موارد پیچیده و حساس مجهز بودند.

سنجه‌های بیشتر همیشه شفافیت بیشتری ایجاد نمی‌کنند

پس از آنکه از ابتدا مشخص شد محصول باید به چه هدفی برسد، بیشتر سازمان‌های سازنده محصولات هوش مصنوعی سرانجام با یک پرسش روبه‌رو می‌شوند: آیا واقعاً کار می‌کند؟

اگر پاسخ روشن نباشد، واکنش غریزی معمولاً افزودن سنجه‌های بیشتر است. سه سنجه به ۱۰ و سپس ۱۰ سنجه به ۳۰ تبدیل می‌شود. داشبورد پربارتر می‌شود، اما شاید درک تیم بهتر نشود.

مشکل همیشه کیفیت تک‌تک سنجه‌ها نیست، بلکه گاهی رابطه میان آن‌هاست. رضایت مشتری، شاخص خالص ترویج‌کنندگان، دیدگاه‌ها و نرخ پسند همگی سیگنال‌های مفیدی هستند، اما ممکن است تغییرات مشابهی را در نگرش کلی بازتاب دهند. وقتی هم‌جهت تغییر می‌کنند، وقوع یک رویداد را تأیید می‌کنند، بی‌آنکه لزوماً علتش را توضیح دهند.

بنابراین، تیم‌های هوش مصنوعی باید فراتر از سنجه‌های همسو بروند و سنجه‌هایی را بیابند که نتایج رقیب را آشکار می‌کنند. این جفت‌های متقابلاً مخرب، اثر مصالحه‌های نهفته در عملکرد محصول را آشکار و قابل پایش می‌کنند و به تصمیم‌گیری بهتر می‌انجامند.

پایش مصالحه‌ها هنگام ساخت عامل‌های صوتی بلادرنگ: وقتی سنجه‌های بیشتر دیگر مفید نبودند

در یکی از استقرارهای پیش از عرضه، تیم مشترک در حال توسعه یک عامل صوتی هوش مصنوعی بلادرنگ برای تماس‌های ورودی پشتیبانی مشتری بود. یکی از دشوارترین پرسش‌ها درباره انتخاب مدل یا هماهنگ‌سازی اجزا نبود. پرسش این بود که سازمان پس از استفاده گسترده مشتریان، چگونه تشخیص دهد محصول کار می‌کند یا نه.

چارچوب اولیه سه سنجه داشت:

  • نرخ مهار: هوش مصنوعی چند بار تماس را بدون انتقال به یک فرد حل می‌کند.

  • نرخ ارجاع: تماس چند بار به یک عامل انسانی منتقل می‌شود.

  • نرخ حل مسئله: مشکل مشتری در نهایت چند بار حل می‌شود.

هر سنجه به‌تنهایی منطقی بود. اما این سنجه‌ها در کنار هم نمی‌توانستند به پرسشی روشن پاسخ دهند: افزایش ارجاع چه چیزی به ما می‌گوید؟

تیم ارجاع را به هشت زیرنوع تفکیک کرد. سپس سنجه‌های انصراف، مسیر و زمان‌بندی، امتیازهای درک زبان و نرخ حل مسئله بر اساس نوع درخواست را افزود. این چارچوب در نهایت شامل ۳۱ سنجه در شش دسته شد.

می‌توانست ارجاع را با جزئیات توصیف کند، اما هنوز قادر نبود علت آن را با اطمینان تشخیص دهد. بیشتر سنجه‌ها گونه‌هایی از یک رفتار واحد بودند؛ بنابراین به‌جای آزمودن توضیحات رقیب، هم‌جهت تغییر می‌کردند.

داشبورد به‌جای ابزاری تشخیصی، صرفاً مشاهده‌گر شده بود.

برای آشکار کردن مصالحه‌ها از جفت‌های متقابلاً مخرب استفاده کنید

آنچه تیم نیاز داشت، لایه دیگری از تفکیک نبود. تیم به سنجه‌هایی نیاز داشت که یکدیگر را مهار کنند.

ما به این‌ها جفت‌های متقابلاً مخرب می‌گوییم: دو سنجه که بهبود جداگانه یکی از آن‌ها می‌تواند به نتیجه‌ای که دیگری نشان می‌دهد آسیب بزند. این نام حالت شکست ناشی از بهینه‌سازی یک‌جانبه را توصیف می‌کند، نه وضعیت مطلوب را.

وقتی هر دو سوی جفت در وضعیت مطلوب بمانند، محصول احتمالاً به‌شکلی پایدار عمل می‌کند. وقتی از هم فاصله می‌گیرند، جهت این واگرایی به تیم کمک می‌کند محل بررسی را تعیین کند.

آنچه داشتیم

جفت متقابلاً مخرب

آنچه این جفت ممکن است آشکار کند

نرخ ارجاع، تفکیک‌شده به هشت زیرنوع

نرخ ارجاع ↔ زمان تا ارجاع

ارجاع فوری ممکن است نشانه مشکل در اعتماد یا نحوه طرح موضوع باشد؛ ارجاع دیرتر شاید نشان دهد سیستم قادر به تکمیل کار نیست.

گزارش جداگانه نرخ مهار و نرخ حل مسئله

نرخ مهار ↔ نگرش مشتری

اینکه مهار نشان‌دهنده حل رضایت‌بخش مسئله است یا انصراف مشتری از تلاش.

نرخ حل مسئله بر اساس نوع هدف

نرخ حل مسئله ↔ عمق مکالمه

اینکه حل موفق مسئله کارآمد است یا به تعاملی فرساینده نیاز دارد.

برای بررسی دقیق‌تر چگونگی آشکار شدن این موضوع و نحوه استفاده از این بینش، نرخ ارجاع و زمان تا ارجاع را در نظر بگیریم. تیم تا زمان دریافت تماس‌های واقعی نمی‌داند مشتریان چگونه رفتار می‌کنند، اما می‌تواند فرضیه‌های لازم برای آزمون را تعریف کند.

اگر تماس‌های بیشتری ارجاع شوند و مشتریان در ۳۰ ثانیه نخست تجربه هوش مصنوعی را ترک کنند، تیم باید اعتماد، شفاف‌سازی، لحن و تعاملات آغازین را بررسی کند. اگر مشتریان پس از چند دقیقه تلاش برای انجام کار درخواست ارجاع دهند، احتمالاً مشکل از توانمندی یا پوشش گردش‌کار است.

عدد اصلی ارجاع یکسان است. اما تصمیم محصول متفاوت است.

یک جفت مفید به‌تنهایی علت را اثبات نمی‌کند. اما دامنه بررسی را محدود و تصمیم بعدی را روشن‌تر می‌کند.

هزینه و کیفیت باید در کنار هم سنجیده شوند

نمونه Klarna که پیش‌تر مطرح شد، کاربرد این اصل را هنگام تعامل هزینه و کیفیت خدمات نشان می‌دهد. این نمونه نشان می‌دهد الگوی عملیاتی مبتنی بر هوش مصنوعی چگونه با پایش اثر مصالحه‌ها و یادگیری از استقرار تکامل می‌یابد.

شرکت در فوریه ۲۰۲۴ گزارش کرد که دستیار هوش مصنوعی آن در ماه نخست ۲٫۳ میلیون مکالمه را مدیریت کرده، معادل کار ۷۰۰ عامل تمام‌وقت را انجام داده و به امتیازهای رضایت مشتری هم‌تراز با عامل‌های انسانی رسیده است. Klarna برآورد کرد این دستیار در سال ۲۰۲۴ باعث ۴۰ میلیون دلار بهبود سود خواهد شد. این‌ها نتایج گزارش‌شده خود Klarna بودند، نه ارزیابی مستقل.

در مه ۲۰۲۵، مدیرعامل Klarna گفت شرکت در خدمات مشتری بیش از حد بر کاهش هزینه تأکید کرده و از برنامه افزایش دسترسی به پشتیبانی انسانی خبر داد. این تصمیم به معنای تنظیم توازن میان خدمات خودکار و انسانی بود، نه رد دستیار هوش مصنوعی یا فناوری زیربنایی آن.

شواهد عمومی نشان می‌دهند چرا سنجه‌های کارایی باید در کنار نیازهای مشتریان و تعاملات گوناگون بررسی شوند. ممکن است یک سیستم هوش مصنوعی در مجموع خوب عمل کند، اما برخی موارد پیچیده، حساس یا نامعمول همچنان از دسترسی آسان به پشتیبانی انسانی بهره ببرند.

پایش هر دو سوی این رابطه به شرکت کمک می‌کند تعیین کند خودکارسازی کجا ارزش می‌آفریند، پشتیبانی انسانی کجا همچنان مهم است و با ظهور شواهد جدید این توازن چگونه باید تغییر کند.

دیگر جفت‌های متقابلاً مخرب در محصولات هوش مصنوعی ممکن است شامل این موارد باشند:

جفت متقابلاً مخرب

ریسکی که به آشکار شدن آن کمک می‌کند

دقت پاسخ ↔ تأخیر پاسخ

سیستمی که از نظر فنی دقیق است، اما برای گردش‌کار بیش از حد کند عمل می‌کند.

تکمیل وظیفه ↔ نرخ بازانجام کار توسط کاربر

گردش‌کار هوش مصنوعی که وظایفی را تکمیل می‌کند که کاربران بارها از نو انجام می‌دهند.

هزینه هر تعامل ↔ کیفیت ارزیابی‌شده خروجی

صرفه‌جویی حاصل از تضعیف تجربه مشتری یا کارمند.

پذیرش ↔ زمان دستیابی به ارزش

رشد ثبت‌نام بدون ایجاد ارزش متناظر برای کاربر.

هدف این نیست که هر دو سنجه تا ابد افزایش یابند. هدف این است که مصالحه پیش از آنکه بهینه‌سازی یک‌جانبه مشکلی عملیاتی ایجاد کند، آشکار شود.

نقطه شروع مشتری معنای یک سنجه را تغییر می‌دهد

چالشی مشابه در استقرار سامانه پشتیبانی از بازیکنان برای یک شرکت بازی‌های موبایلی پدید آمد. سیستم مشکلات پرتکراری مانند از دست رفتن پیشرفت بازی، اختلاف‌های پرداخت و دسترسی به حساب را مدیریت می‌کرد.

سنجه‌های کارایی مهم بودند، زیرا سیستم در مقیاس گسترده کار می‌کرد. اما پشتیبانی بازیکنان صرفاً یک صف عملیاتی نیست. بازیکنان اغلب سرخورده مراجعه می‌کنند، زیرا پیش‌تر در بخش دیگری از تجربه‌شان مشکلی رخ داده است.

این نقطه شروع، نحوه تفسیر داده‌های رضایت مشتری را تغییر می‌دهد. بازیکنی که مشکلش به‌درستی حل شده شاید همچنان رضایت کمی گزارش کند، چون در ابتدا پیشرفت خود را از دست داده است. تفسیر این امتیاز بدون توجه به زمینه، ممکن است تعامل پشتیبانی را بابت سرخوردگی ایجادشده در مراحل پیشین مسیر مشتری جریمه کند.

بنابراین، تیم باید نگرش اولیه مشتری را از اثر تجربه پشتیبانی تفکیک می‌کرد. پرسش مفیدتر این نبود: «آیا بازیکن راضی بود؟» بلکه این بود: «آیا تعامل، وضعیت را نسبت به نقطه شروع بازیکن بهتر کرد؟»

به‌شرط وجود روشی قابل‌اعتماد برای سنجش هر دو، این مقایسه می‌تواند سرخوردگی ناشی از محصول را از کیفیت پشتیبانی تفکیک کند.

سنجش باید همراه با محصول تغییر کند

محصولات هوش مصنوعی تغییر می‌کنند، اما سنجه‌هایشان اغلب ثابت می‌مانند.

در مرحله آزمایشی، پرسش اصلی شاید این باشد که آیا سیستم برای توجیه ادامه سرمایه‌گذاری به‌اندازه کافی قابل‌اعتماد است:

  • آیا وظیفه اصلی را با اطمینان تکمیل می‌کند؟

  • آیا کاربران آن‌قدر به آن اعتماد دارند که ادامه دهند؟

  • خارج از رایج‌ترین سناریوها چگونه رفتار می‌کند؟

  • آیا می‌توان شکست‌ها را شناسایی و به‌شکلی ایمن بازیابی کرد؟

این پرسش‌ها جفت‌هایی مانند موارد زیر را مناسب‌تر می‌کنند:

  • موفقیت در وظیفه اصلی ↔ عملکرد در موارد خاص؛

  • نرخ خودکارسازی ↔ نرخ مداخله انسانی؛ و

  • سرعت تکمیل ↔ اطمینان کاربر.

وقتی محصول از نظر عملیاتی مهم می‌شود، پرسش‌ها تغییر می‌کنند:

  • آیا می‌تواند بدون کاهش کیفیت مقیاس‌پذیر شود؟

  • آیا صرفه اقتصادی آن با افزایش استفاده بهتر می‌شود؟

  • آیا با افزایش پذیرش، عملکرد پایدار می‌ماند؟

  • آیا مداخلات انسانی در موقعیت‌های مناسب رخ می‌دهند؟

جفت‌های مربوط ممکن است به این موارد تغییر کنند:

  • هزینه هر تعامل ↔ کیفیت ارزیابی‌شده خروجی؛

  • گستره پذیرش ↔ عمق استفاده؛ و

  • نرخ خودکارسازی ↔ میزان مواجهه با ریسک عملیاتی.

سنجه‌های اولیه لزوماً اشتباه نیستند. آن‌ها به پرسش‌های مهم مرحله‌ای پیشین پاسخ می‌دهند.

خطر هنگام گذار پدید می‌آید. سنجه‌های مرحله آزمایشی اغلب باقی می‌مانند، زیرا تیم‌ها شیوه گزارش آن‌ها را می‌دانند و هیچ‌کس مسئول تصمیم‌گیری درباره کنار گذاشتنشان نیست. سنجه‌هایی که زمانی به یادگیری کمک می‌کردند، ممکن است به‌تدریج به سنجه‌های نمایشی تبدیل شوند.

بنابراین، جفت‌ها باید چرخه عمر داشته باشند. تیم‌ها باید آن‌ها را برای تصمیمی مشخص معرفی کنند، بررسی کنند که آیا هنوز مصالحه‌ای مهم را آشکار می‌کنند و با تغییر محصول یا تصمیم، کنارشان بگذارند.

پایش و تصمیم‌گیری دو لایه متفاوت‌اند

سیستم‌های هوش مصنوعی به مشاهده‌پذیری دقیق، هشداردهی، تضمین کیفیت و ارزیابی نیاز دارند. حذف این سیگنال‌ها بهره‌برداری ایمن از محصول را دشوارتر می‌کند. اما پایش عملیاتی با سنجش مدیریتی یکسان نیست.

پایش به تیم‌ها کمک می‌کند رخدادها را شناسایی، شکست‌ها را ریشه‌یابی و رفتار سیستم را درک کنند. سنجه‌های تصمیم‌گیری به رهبران محصول و کسب‌وکار کمک می‌کنند درباره سرمایه‌گذاری، مداخله، تغییر مسیر یا پذیرش یک مصالحه تصمیم بگیرند.

ممکن است سازمانی صدها سیگنال فنی و عملیاتی را پایش کند، اما برای یک تصمیم خاص محصول فقط دو یا سه جفت متقابلاً مخرب را در سطح تصمیم‌گیری مطرح سازد. کوچک نگه‌داشتن این لایه تصمیم‌گیری، اولویت‌بندی را آسان‌تر می‌کند.

تناوب مناسب بازبینی به محصول بستگی دارد. یک سیستم جدید یا به‌سرعت در حال تغییر شاید به بازبینی هفتگی تصمیم‌ها نیاز داشته باشد، اما برای محصولی بالغ، بازبینی ماهانه یا فصلی کافی است. اصل موضوع مهم‌تر از فاصله زمانی است: جفت را آن‌قدر منظم بازبینی کنید که پیش از پرهزینه یا ناایمن شدن مصالحه بتوان اقدام کرد.

مشخص کنید جفت باید چه اقدامی را فعال کند

یک جفت تنها زمانی مفید می‌شود که سازمان توافق کند در صورت افت آن چه اتفاقی بیفتد.

این کار به چیزی بیش از تعیین مرز قرمز برای واگرایی نیاز دارد. تیم‌ها باید سه وضعیت را در نظر بگیرند:

  • شکست مطلق: یکی از سنجه‌ها، مستقل از دیگری، از آستانه‌ای غیرقابل‌قبول عبور می‌کند.

  • واگرایی: یک سنجه بهبود می‌یابد و سنجه متعادل‌کننده آن افت می‌کند.

  • افت هم‌زمان: هر دو سو افت می‌کنند که نشان‌دهنده مشکلی گسترده‌تر در محصول یا عملیات است.

هر جفت باید این موارد را داشته باشد:

  • یک مسئول مشخص؛

  • تصمیم روشنی که از آن پشتیبانی می‌کند؛

  • آستانه‌ها یا معیارهای ارزیابی مورد توافق؛

  • یک مسیر بررسی؛ و

  • مجموعه‌ای از مداخلات احتمالی.

بدون این عناصر، سازمان به‌جای مدیریت محصول فقط آن را مشاهده می‌کند.

پنج پرسش برای بازبینی بعدی سنجه‌ها

پیش از افزودن سنجه‌ای دیگر، یک تصمیم مهم محصول را انتخاب کنید و به این پرسش‌ها پاسخ دهید. پاسخ‌ها را بنویسید تا بازبینی با توافق درباره گام بعدی پایان یابد.

۱. این سنجه‌ها باید در گرفتن کدام تصمیم به ما کمک کنند؟

دقیق باشید: آیا باید درباره گسترش خودکارسازی، تغییر مدل یا بهبود تحویل کار به انسان تصمیم بگیریم؟ پیش از انتخاب سنجه‌ها، تصمیم را مشخص کنید.

۲. اگر این عدد بهتر شود، چه چیزی ممکن است بدتر شود؟

نتیجه‌ای را که باید حفظ کنید و سنجه‌ای را که آسیب را آشکار می‌کند، مشخص کنید. برای نمونه، هزینه هر تعامل را با کیفیت ارزیابی‌شده خروجی جفت کنید تا مشخص شود پاسخ‌های ارزان‌تر همچنان مفیدند یا نه.

۳. اعداد اصلی چه چیزی را ممکن است پنهان کنند؟

هر دو سنجه را برای کاربران، وظایف و بازه زمانی یکسان بررسی کنید و سپس گروه‌هایی را بیابید که نتایج بدتری دارند. شرایط اولیه را نیز در نظر بگیرید: رضایت کم ممکن است بازتاب سرخوردگی پیش از تعامل با پشتیبانی باشد.

۴. چه چیزی ما را به اقدام وامی‌دارد و مسئول واکنش کیست؟

برای اقدام در سه حالت معیار تعیین کنید: عبور سنجه‌ای از حد غیرقابل‌قبول، بهبود یکی و افت دیگری، یا افت هر دو. توافق کنید چه کسی بررسی کند، ابتدا چه چیزی را بسنجد و چه زمانی نتیجه را گزارش دهد.

۵. آیا این جفت هنوز با مرحله کنونی محصول متناسب است؟

تصمیم بگیرید آن را حفظ، جایگزین یا کنار بگذارید. یک طرح آزمایشی ممکن است بر قابلیت اطمینان وظیفه و اعتماد کاربر تمرکز کند؛ یک سرویس فعال شاید به بررسی دقیق‌تر هزینه و کیفیت نیاز داشته باشد. تاریخی برای بازنگری این انتخاب تعیین کنید.

سنجش محصول هوش مصنوعی باید فراتر از توصیف عملکرد باشد. باید مصالحه‌های سازمان را آشکار و تصمیم بعدی را روشن‌تر کند.

نویسندگان

Ale Zacarias،‏ Josie Steer