مرکزی نیویگیشن

زیادہ خطرے والے کاروباروں کے لیے محفوظ چیٹ ایجنٹس کی تیاری

اپنے برانڈ کی نمائندگی کے لیے چیٹ بوٹ بناتے وقت صرف اس کا محفوظ ہونا کافی نہیں، اسے حقیقی معنوں میں آپ ہی کی آواز لگنا چاہیے.

انتظامی خلاصہ

  • عوام کے لیے دستیاب LLM ایپلی کیشنز برانڈز کو ساکھ اور مالی نقصان کے خطرات سے دوچار کر سکتی ہیں.

  • ہم LLM جیل بریکس اور LLM کے دیگر غیر ارادی رویوں سے ہونے والے نقصان کو کم کرنے کے لیے درجہ بندی کے تہہ دار فلٹرز استعمال کرتے ہیں.

  • ہم نے اسے ایک بڑے پیمانے کی پروڈکشن ایپلی کیشن میں نافذ کیا ہے، جس پر روزانہ 40,000 سے زیادہ اور مسلسل بڑھتے ہوئے پیغامات آتے ہیں.

تعارف

گزشتہ سال کے دوران، ہم نے ایک معروف گیم ڈویلپر کے ساتھ مل کر ایک جنریٹو اے آئی چیٹ بوٹ متعارف کرایا، جو بچوں سمیت کھلاڑیوں کی جانب سے آنے والے تقریباً 40,000 روزانہ پیغامات کا جواب دیتا ہے. رفتار، درستگی، تحفظ اور تفریح میں توازن رکھنا ضروری ہے:

اپنے برانڈ کی نمائندگی کے لیے چیٹ بوٹ بناتے وقت صرف اس کا محفوظ ہونا کافی نہیں، اسے حقیقی معنوں میں آپ ہی کی آواز لگنا چاہیے.

گیم کمپنی کے معاملے میں اس کا مطلب تحفظ کو تفریح اور صارفین کے جوش کے ساتھ جوڑنا ہے، بالخصوص کم عمر صارفین کے لیے.

جدید جنریٹو اے آئی ایپلی کیشنز کی بنیاد بننے والے LLM نہایت لچک دار ہیں، اسی لیے وہ کئی مسائل پر اچھی طرح قابلِ اطلاق ہوتے ہیں، مگر ان پر پابندیاں بھی کم ہوتی ہیں. اس کا مطلب ہے کہ وہ اکثر طے شدہ حدود سے ہٹ کر کئی طرح کا متن واپس کر سکتے ہیں، جس میں سے کچھ نامناسب بھی ہو سکتا ہے.

کسی LLM کو براہِ راست عوام کے سامنے پیش کرنے سے غیر متوقع رویہ ضرور سامنے آئے گا اور مناسب حفاظتی تدابیر کے بغیر درج ذیل خطرات پیدا ہو سکتے ہیں:

حقیقی دنیا کے خطرات کی ایک جھلک...

LLM کے غیر ارادی استعمال سے متعلق خبروں کی سرخیاں:

یہ واقعات واضح کرتے ہیں کہ جنریٹو اے آئی نظاموں میں تحفظ قائم کرنا اور اسے برقرار رکھنا اختیاری نہیں ہے. یہ بات خصوصاً اس وقت درست ہے جب کم عمر بچے شامل ہوں۔ صرف انتباہی وضاحتوں پر انحصار نہیں کیا جا سکتا؛ مواد کو مناسب رکھنے کے لیے مضبوط حفاظتی حدود ضروری ہیں.

ہمارا طریقہ: تہہ دار درجہ بندی اور پرومپٹ کیشنگ

صارفین کے لیے بنائے گئے ہمارے بازیافت سے تقویت یافتہ تخلیق کے نظاموں کی طرح، ہم کارکردگی بلند رکھتے ہوئے جیل بریکنگ کے خطرات کم کرنے کے لیے متعدد مصنوعی ذہانت کے اجزا استعمال کرتے ہیں.

ہمارے طریقے، تہہ دار درجہ بندی اور پرومپٹ کیشنگ، کی وضاحت کرنے والا خاکہ.

ہمارے نظام کا ایک آسان بنایا گیا ساختی خاکہ

نظام کا تحفظ یقینی بنانے کے لیے ہم ان پٹ اور آؤٹ پٹ دونوں پر LLM درجہ بند استعمال کرتے ہیں:

  1. ان پٹ کی درجہ بندی، جو بیک وقت چلتی ہے

  • ہم نے صارف کے سوالات کو SAFE، SUSPICIOUS، CHILD_HARM_RISK، VIOLENT وغیرہ کے خانوں میں رکھنے کے لیے پائیڈینٹک اسکیماؤں کے ساتھ LLM اسٹرکچرڈ آؤٹ پٹس استعمال کیے. اس میں جیل بریکنگ یا ممنوعہ رویے کی شناخت کے لیے نشانات بھی شامل تھے.

  • الگ الگ موضوعات کے لیے متعدد درجہ بندوں نے ایک بڑے ”سب کچھ پکڑنے والے“ درجہ بند کے مقابلے میں نمایاں طور پر بہتر کارکردگی دکھائی.

  • تفصیلی فیو-شاٹ مثالیں اس لیے نہایت اہم تھیں کہ درجہ بند ”یہ کردار مجھے بار بار مار دیتا ہے“، یعنی گیم کا حوالہ، اور ”میرے والدین مجھے تکلیف پہنچا رہے ہیں“، یعنی بچے کو نقصان کا اشارہ، کے درمیان فرق کر سکیں.

  • صارف اور ان کی ماہر اعتماد و تحفظ ٹیموں کے ساتھ قریبی تعاون نے یقینی بنایا کہ ہمارے درجہ بند حقیقی زندگی کے زیادہ خطرے والے پیغامات کے بارے میں انہی کے فیصلوں کی عکاسی کریں.

ہمارے طریقے، تہہ دار درجہ بندی اور پرومپٹ کیشنگ، کی وضاحت کرنے والا خاکہ.

  1. جواب کی تیاری

  • اگر ان پٹ محفوظ قرار پائے تو مرکزی LLM جواب تیار کرتا ہے.

  • بصورتِ دیگر، پیغام کو نظر انداز کیا جا سکتا ہے، اگر وہ جیل بریک ہو، یا کسی انسان کو بھیجا جا سکتا ہے، اگر سوال تحفظ کا مسئلہ ظاہر کرے.

  1. آؤٹ پٹ کی درجہ بندی

  • جواب ہماری ایپلی کیشن سے باہر بھیجنے سے پہلے، ہم حتمی ترسیل کے لیے ماڈل کے جواب کی درجہ بندی کرتے ہیں.

  • چونکہ بعض جوابات میں انٹرنیٹ سے اخذ کیے گئے ڈیٹا پر بازیافت سے تقویت یافتہ تخلیق کی تکنیکیں استعمال ہو سکتی ہیں، اس لیے یہ مرحلہ ہمیں ڈیٹا میں زہر آلودگی سے بچاتا ہے.

  • اگر جواب میں ممنوعہ مواد ہو تو نظام مداخلت کر کے اسے ایک عمومی پیغام سے بدل دیتا ہے. عملی طور پر ایسا شاذ ہی ہوا ہے، لیکن یہ ایک اضافی محتاط حفاظتی تہہ ہے جو ایجنٹ کے رویے کو مناسب رکھتی ہے.

رفتار اور کم لاگت برقرار رکھنے کے لیے:

  • ہم عام طور پر استعمال ہونے والے پرومپٹس، جزوی مکالمے اور منتخب فیو-شاٹ مثالیں محفوظ کرتے ہیں.

  • یہ کیشنگ ہمیں ہر بار سیاق و سباق دوبارہ بنائے بغیر LLM درجہ بندوں کو تیزی اور کم لاگت سے استعمال کرنے دیتی ہے.

ہمارے طریقے، تہہ دار درجہ بندی اور پرومپٹ کیشنگ، کی وضاحت کرنے والا خاکہ.

مستقبل کی سمت: آئینی درجہ بند

اینتھروپک کی ایک حالیہ تحقیق میں آئینی درجہ بندوں کا ذکر کیا گیا ہے۔ یہ ایسا نظام ہے جو بدنیتی پر مبنی یا غیر محفوظ درخواستوں کا پتا لگانے کے لیے ”آئینی“ اصولوں کے تحت تربیت یافتہ اضافی درجہ بندوں پر انحصار کرتا ہے. ان کے مطابق:

  • انسانوں کی ہزاروں گھنٹوں کی ریڈ ٹیمنگ کے مقابلے میں انتہائی مضبوطی.

  • غیر ضروری انکار کی بہت کم شرح اور حسابی وسائل پر معتدل اضافی بوجھ.

ہم ایک ایسے مستقبل کا امکان دیکھتے ہیں جہاں یہ آئینی طریقے روایتی درجہ بندی کی تہوں کی تکمیل یا ان کی جگہ لے سکیں گے اور بدلتی ہوئی جیل بریکنگ تدبیروں کے خلاف زیادہ جامع دفاع فراہم کریں گے.

خلاصہ: ہم نے کیا سیکھا

  1. متوازی اور ہلکے فلٹرز

درجہ بندی کی تہیں بدنیتی پر مبنی سوالات کو تخلیقی مرکز تک پہنچنے سے روکتی ہیں اور یقینی بناتی ہیں کہ ناقص نتائج کبھی صارف تک نہ پہنچیں.

  1. صارف کا تجربہ اہم ہے

تفریح، کہانی پر مبنی تنبیہات اور خوش مزاج انداز میں انکار پر توجہ دینے سے صارفین نظام کی پابندیاں قبول کرنے پر زیادہ آمادہ ہوتے ہیں.

  1. جانچ اور نگرانی میں کوئی کسر نہ چھوڑیں

باقاعدہ ریڈ ٹیمنگ اور کھلاڑیوں کے رویے کی مسلسل نگرانی سے کمزوریاں وسیع تر کھلاڑی برادری کے علم میں آنے سے پہلے سامنے آ سکتی ہیں. پھر ان معلومات کو فیو-شاٹ درجہ بند کے پرومپٹس میں شامل کیا جا سکتا ہے تاکہ مستقبل میں ان کمزوریوں کا استعمال روکا جا سکے۔ فی الحال یہ عمل دستی ہے، مگر اسے خودکار بنایا جا سکتا ہے.

مستقبل کے لیے محفوظ اور دل چسپ جنریٹو اے آئی نظاموں کی تیاری

خواہ آپ گیم کمپنی ہوں، بینک یا سرکاری محکمہ، اگر آپ بڑے پیمانے پر صارف خدمت کا چیٹ بوٹ نافذ کرنا چاہتے ہیں تو آپ کو صارف پر مبنی ڈیزائن اور قابلِ اعتماد ہونے، دونوں کو یکساں اہمیت دینی ہوگی.

ہم ایسی تنظیموں اور برانڈز کے لیے صارفین کے سامنے پیش کیے جانے والے حل بناتے ہیں جہاں:

  1. تحفظ سب سے اہم ہے۔ ایسے چیٹ بوٹس جو صارفین کو فائدہ پہنچائیں اور انہیں نقصان دہ مواد سے سختی کے ساتھ محفوظ رکھیں.

  2. ساکھ محفوظ رہتی ہے۔ ہم تحفظ کی متعدد تہیں تیار کرتے ہیں جو صارفین کی جانب سے نظام کو حدود سے آگے دھکیلنے کی کوشش کے باوجود برانڈ کی ساکھ برقرار رکھتی ہیں.

  3. ضوابط آپ کے اختیارات محدود کرتے ہیں۔ ہم تعمیل کے تازہ ترین رہنما اصولوں سے باخبر رہتے ہیں، تاکہ آپ ایپلی کیشن کے جیل بریک ہونے کی فکر کے بغیر اپنے حل کو وسیع کر سکیں.

مصنف

Andrew Liubinas