ناوبری اصلی

ساخت عامل‌های گفت‌وگوی ایمن برای کسب‌وکارهای پرخطر

وقتی چت‌باتی برای نمایندگی برندتان می‌سازید، صرفاً ایمن بودنش کافی نیست؛ باید واقعاً لحن خودتان را داشته باشد.

خلاصهٔ اجرایی

  • برنامه‌های عمومی مبتنی بر الگوهای زبانی بزرگ (LLM) می‌توانند برندها را با خطرهای اعتباری و مالی روبه‌رو کنند.

  • ما برای کاهش آسیب‌های ناشی از دور زدن محدودیت‌های الگوهای زبانی بزرگ (LLM) و دیگر رفتارهای ناخواستهٔ آن‌ها، از فیلترهای طبقه‌بندی چندلایه استفاده می‌کنیم.

  • این رویکرد را در یک برنامهٔ عملیاتی پرترافیک به کار گرفته‌ایم که روزانه ۴۰٬۰۰۰ پیام، و هر روز بیشتر از قبل، دریافت می‌کند.

مقدمه

طی سال گذشته، با یکی از توسعه‌دهندگان پیشرو بازی همکاری کرده‌ایم تا چت‌باتی مبتنی بر هوش مصنوعی مولد راه‌اندازی کنیم که از میان بازیکنانی شامل کودکان، روزانه حدود ۴۰٬۰۰۰ پیام دریافت می‌کند. برقراری تعادل میان سرعت، دقت، ایمنی و سرگرمی ضروری است:

وقتی چت‌باتی برای نمایندگی برندتان می‌سازید، صرفاً ایمن بودنش کافی نیست؛ باید واقعاً لحن خودتان را داشته باشد.

برای یک شرکت بازی‌سازی، این یعنی ترکیب ایمنی با سرگرمی و هیجان کاربران، به‌ویژه برای مخاطبان کم‌سن‌تر.

الگوهای زبانی بزرگ (LLM) زیربنای برنامه‌های مدرن هوش مصنوعی مولد بسیار انعطاف‌پذیرند؛ به همین دلیل برای مسائل گوناگون به‌خوبی تعمیم می‌یابند، اما محدودیت‌های کافی نیز ندارند. در نتیجه، ممکن است از مسیر تعیین‌شده خارج شوند و انواع گوناگونی از متن را تولید کنند که برخی از آن‌ها احتمالاً نامناسب‌اند.

قرار دادن مستقیم یک الگوی زبانی بزرگ (LLM) در دسترس عموم بی‌تردید به رفتارهای پیش‌بینی‌نشده منجر می‌شود و بدون تمهیدات مناسب، این خطرها را به همراه دارد:

نگاهی کوتاه به خطرهای دنیای واقعی…

تیترهای خبری دربارهٔ استفادهٔ ناخواسته از الگوهای زبانی بزرگ (LLM):

این رویدادها نشان می‌دهند که ایجاد و حفظ ایمنی در سامانه‌های هوش مصنوعی مولد امری اختیاری نیست. این موضوع به‌ویژه وقتی کودکان خردسال در میان باشند اهمیت دارد؛ نمی‌توان صرفاً به سلب مسئولیت‌ها تکیه کرد و برای مناسب نگه داشتن محتوا، وجود سازوکارهای حفاظتی قدرتمند ضروری است.

رویکرد ما: طبقه‌بندی چندلایه و ذخیره‌سازی اعلان در حافظهٔ نهان

مانند سامانه‌های RAG (تولید تقویت‌شده با بازیابی) که برای مشتریان ساخته‌ایم، از چند مؤلفهٔ هوش مصنوعی بهره می‌بریم تا ضمن حفظ عملکرد بالا، خطر دور زدن محدودیت‌ها را کاهش دهیم.

نموداری از رویکرد ما: طبقه‌بندی چندلایه و ذخیره‌سازی اعلان در حافظهٔ نهان.

نمودار ساده‌شدهٔ معماری سامانهٔ ما

برای تضمین ایمنی سامانه، هم ورودی‌ها و هم خروجی‌ها را با طبقه‌بندهای الگوهای زبانی بزرگ (LLM) بررسی می‌کنیم:

  1. طبقه‌بندی ورودی‌ها (به‌صورت هم‌زمان)

  • برای برچسب‌گذاری درخواست‌های کاربران، از شِماهای Pydantic در کنار خروجی های دارای ساختار الگوهای زبانی بزرگ (LLM) استفاده کردیم؛ برای نمونه SAFE، SUSPICIOUS، CHILD_HARM_RISK و VIOLENT. این سازوکار همچنین شامل پرچم‌هایی برای شناسایی دور زدن محدودیت‌ها یا رفتارهای غیرمجاز بود.

  • استفاده از چند طبقه‌بند برای موضوعات جداگانه، عملکردی به‌مراتب بهتر از یک طبقه‌بند بزرگ و همه‌منظوره داشت.

  • استفادهٔ گسترده از مثال‌های چند نمونه ضروری بود تا طبقه‌بندها میان “I keep being killed by this character” (اشاره به بازی) و “I am being hurt by my parent” (نشانهٔ آسیب به کودک) تمایز قائل شوند.

  • همکاری نزدیک با مشتری و تیم‌های تخصصی اعتماد و ایمنی او باعث شد طبقه‌بندهای ما همان قضاوتی را دربارهٔ پیام‌های پرخطر داشته باشند که این تیم‌ها در دنیای واقعی دارند.

نموداری از رویکرد ما: طبقه‌بندی چندلایه و ذخیره‌سازی اعلان در حافظهٔ نهان.

  1. تولید پاسخ

  • اگر ورودی ایمن تشخیص داده شود، الگوی زبانی بزرگ (LLM) اصلی پاسخی تولید می‌کند.

  • در غیر این صورت، پیام را می‌توان نادیده گرفت، اگر با هدف دور زدن محدودیت‌ها باشد، یا برای بررسی انسانی ارجاع داد، اگر درخواست نشانه‌ای از مشکل ایمنی داشته باشد.

  1. طبقه‌بندی خروجی

  • پیش از ارسال نهایی، پاسخ مدل را در برنامهٔ خود طبقه‌بندی می‌کنیم.

  • از آنجا که برخی پاسخ‌ها ممکن است با روش‌های RAG و داده‌های استخراج‌شده از اینترنت تولید شوند، این مرحله از ما در برابر مسموم‌سازی داده محافظت می‌کند.

  • اگر پاسخ حاوی محتوای غیرمجاز باشد، سامانه مداخله می‌کند و آن را با پیامی عمومی جایگزین می‌کند. در عمل به‌ندرت با چنین وضعیتی روبه‌رو شده‌ایم، اما این لایهٔ احتیاطی کمک می‌کند رفتار عامل همواره مناسب بماند.

برای حفظ سرعت و مقرون‌به‌صرفه بودن:

  • اعلان‌های پرکاربرد و گفت‌وگوهای ناقص را همراه با مجموعه‌ای گزینش‌شده از مثال‌های چند نمونه ذخیره می‌کنیم.

  • این ذخیره‌سازی در حافظهٔ نهان به ما امکان می‌دهد طبقه‌بندهای الگوهای زبانی بزرگ (LLM) را سریع و کم‌هزینه اجرا کنیم، بدون آنکه هر بار زمینه را از نو بسازیم.

نموداری از رویکرد ما: طبقه‌بندی چندلایه و ذخیره‌سازی اعلان در حافظهٔ نهان.

نگاهی به آینده: طبقه‌بندهای مبتنی بر اصول بنیادین

پژوهشی تازه از Anthropic، «طبقه‌بندهای مبتنی بر اصول بنیادین» را معرفی کرده است؛ سامانه‌ای متکی بر طبقه‌بندهای اضافی که با قواعدی «بنیادین» آموزش دیده‌اند تا درخواست‌های مخرب یا ناایمن را شناسایی کنند. نتایج گزارش‌شده عبارت بودند از:

  • مقاومت بالا در برابر هزاران ساعت تیم قرمز انسانی.

  • نرخ بسیار کم رد کردن بی‌مورد درخواست‌ها و سربار محاسباتی متوسط.

در آینده، این رویکردهای مبتنی بر اصول بنیادین می‌توانند مکمل یا حتی جایگزین لایه‌های طبقه‌بندی سنتی شوند و دفاعی جامع‌تر در برابر روش‌های رو‌به‌تکامل دور زدن محدودیت‌ها فراهم کنند.

خلاصه: آموخته‌های ما

  1. فیلترهای سبک و موازی

لایه‌های طبقه‌بندی مانع رسیدن درخواست‌های مخرب به هستهٔ مولد می‌شوند و تضمین می‌کنند خروجی‌های نامناسب هرگز به کاربر تحویل داده نشوند.

  1. تجربهٔ کاربری اهمیت دارد

وقتی هشدارها سرگرم‌کننده و برگرفته از داستان بازی باشند و درخواست‌ها با لحنی شوخ‌طبعانه رد شوند، کاربران محدودیت‌های سامانه را راحت‌تر می‌پذیرند.

  1. در آزمون و پایش کوتاهی نکنید

اجرای منظم تیم قرمز و پایش مداوم رفتار بازیکنان کمک می‌کند آسیب‌پذیری‌ها پیش از آگاهی جامعهٔ گسترده‌تر بازیکنان شناسایی شوند. سپس می‌توان این موارد را به اعلان‌های چند نمونهٔ طبقه‌بند افزود تا در آینده قابل بهره‌برداری نباشند؛ در حال حاضر این فرایند دستی است، اما امکان خودکارسازی آن وجود دارد.

ساخت سامانه‌های ایمن و جذاب هوش مصنوعی مولد برای فردا

چه شرکت بازی‌سازی باشید، چه بانک یا حتی یک نهاد دولتی، برای پیاده‌سازی گستردهٔ چت‌بات خدمات مشتریان باید هم‌زمان تجربهٔ کاربری و قابل‌اعتماد بودن را هدف قرار دهید.

ما برای سازمان‌ها و برندهایی راهکارهای ویژهٔ مشتریان می‌سازیم که در آن‌ها:

  1. ایمنی بالاترین اولویت است—چت‌بات‌هایی که برای کاربران ارزش‌آفرینی می‌کنند و در عین حال آنان را کاملاً از محتوای مضر محفوظ نگه می‌دارند

  2. اعتبار برند محافظت می‌شود—چندین لایهٔ حفاظتی طراحی می‌کنیم تا حتی اگر کاربران بکوشند سامانه را از محدودیت‌هایش فراتر ببرند، اعتبار برند خدشه‌دار نشود

  3. مقررات گزینه‌های شما را محدود می‌کنند—ما همواره تازه‌ترین دستورالعمل‌های انطباق را دنبال می‌کنیم تا بتوانید راهکارها را بدون نگرانی از دور زدن محدودیت‌های برنامه‌تان گسترش دهید

نویسنده

Andrew Liubinas