التنقل الرئيسي

إنشاء وكلاء محادثة آمنين للمؤسسات عالية المخاطر

عند إنشاء روبوت محادثة يمثّل علامتك التجارية، لا يكفي أن يكون آمنًا؛ بل يجب أن يعبّر عن هويتك بصدق.

الملخص التنفيذي

  • قد تعرّض تطبيقات النماذج اللغوية الكبيرة (LLM) المتاحة للجمهور العلامات التجارية لمخاطر مالية ومخاطر تمس السمعة.

  • نستخدم مرشحات تصنيف متعددة الطبقات للحد من أضرار تجاوز إجراءات حماية النماذج اللغوية الكبيرة (LLM) وغيرها من سلوكياتها غير المقصودة.

  • طبّقنا هذا النهج في تطبيق إنتاجي كثيف الاستخدام يستقبل 40,000 رسالة يوميًا، والعدد في ازدياد.

مقدمة

على مدار العام الماضي، تعاونا مع شركة رائدة في تطوير الألعاب لإطلاق روبوت محادثة قائم على الذكاء الاصطناعي التوليدي، يتعامل مع نحو 40,000 رسالة يوميًا من قاعدة لاعبين تضم أطفالًا. من الضروري الموازنة بين السرعة والدقة والسلامة والمتعة:

عند إنشاء روبوت محادثة يمثّل علامتك التجارية، لا يكفي أن يكون آمنًا؛ بل يجب أن يعبّر عن هويتك بصدق.

وبالنسبة إلى شركات الألعاب، يعني ذلك الجمع بين السلامة والمتعة وإثارة حماس المستخدمين، ولا سيما صغار السن.

تتميز النماذج اللغوية الكبيرة (LLM) التي تقوم عليها تطبيقات الذكاء الاصطناعي التوليدي الحديثة بمرونة كبيرة، ولهذا يمكن تعميمها بكفاءة على مشكلات كثيرة، لكنها لا تخضع لقيود كافية. وهذا يعني أنها قد تنحرف عن المسار المتوقع وتُرجع طيفًا واسعًا من النصوص، قد يكون بعضها غير ملائم.

سيؤدي إتاحة نموذج لغوي كبير (LLM) للجمهور مباشرةً حتمًا إلى سلوكيات غير متوقعة، وقد ينطوي، من دون إجراءات تخفيف مناسبة، على مخاطر مثل:

لمحة عن المخاطر الواقعية…

عناوين إخبارية عن الاستخدام غير المقصود للنماذج اللغوية الكبيرة (LLM):

تؤكد هذه الحوادث أن بناء أنظمة الذكاء الاصطناعي التوليدي مع الحفاظ على سلامتها ليس أمرًا اختياريًا. ويكتسب ذلك أهمية خاصة عندما يتعلق الأمر بأطفال صغار؛ فلا يمكن الاكتفاء بإخلاءات المسؤولية، بل لا بد من ضوابط حماية قوية لضمان ملاءمة المحتوى.

نهجنا: التصنيف متعدد الطبقات والتخزين المؤقت للمطالبات

على غرار أنظمة التوليد المعزّز بالاسترجاع (RAG) التي أنشأناها للعملاء، نستعين بمكونات متعددة للذكاء الاصطناعي للحد من مخاطر تجاوز إجراءات الحماية مع الحفاظ على مستوى أداء عالٍ.

رسم تخطيطي يوضح نهجنا: التصنيف متعدد الطبقات والتخزين المؤقت للمطالبات.

رسم تخطيطي مبسّط لبنية نظامنا

لضمان سلامة النظام، نستخدم مصنّفات قائمة على النماذج اللغوية الكبيرة (LLM) للمدخلات والمخرجات معًا:

  1. تصنيف المدخلات (يُجرى بالتوازي)

  • استخدمنا مخططات Pydantic إلى جانب مخرجات منظَّمة من النماذج اللغوية الكبيرة (LLM) لتصنيف استفسارات المستخدمين (مثل SAFE وSUSPICIOUS وCHILD_HARM_RISK وVIOLENT وغيرها). وشمل ذلك أيضًا مؤشرات لرصد محاولات تجاوز إجراءات الحماية أو السلوكيات المحظورة.

  • حققت المصنّفات المتعددة المخصصة لموضوعات منفردة أداءً أفضل بكثير من مصنّف واحد ضخم يحاول «تغطية كل شيء».

  • كانت الأمثلة الموسّعة قليلة الأمثلة ضرورية لضمان تمييز المصنّفات بين “I keep being killed by this character” (في سياق اللعبة) و“I am being hurt by my parent” (وهي إشارة إلى تعرض طفل للأذى).

  • ضمن التعاون الوثيق مع العميل وفرقه المتخصصة في الثقة والسلامة أن تعكس مصنّفاتنا الطريقة التي سيقيّمون بها الرسائل عالية الخطورة في الواقع.

رسم تخطيطي يوضح نهجنا: التصنيف متعدد الطبقات والتخزين المؤقت للمطالبات.

  1. إنشاء الرد

  • ينشئ النموذج اللغوي الكبير (LLM) الرئيسي ردًا إذا اعتُبرت المدخلات آمنة.

  • وإلا، فيمكن تجاهل الرسالة إذا كانت محاولة لتجاوز إجراءات الحماية، أو إحالتها إلى مختص إذا كشف الاستفسار عن مشكلة تتعلق بالسلامة.

  1. تصنيف المخرجات

  • نصنّف رد النموذج قبل خروجه من تطبيقنا وتسليمه نهائيًا.

  • نظرًا إلى أن بعض الردود قد تستخدم تقنيات التوليد المعزّز بالاسترجاع (RAG) مع بيانات مستخرجة من الإنترنت، تحمينا هذه الخطوة من تسميم البيانات.

  • إذا تضمّن الرد محتوى محظورًا، يتدخل النظام ويستبدله برسالة عامة. نادرًا ما واجهنا ذلك عمليًا، لكنه يشكل طبقة حماية احترازية إضافية لضمان بقاء سلوك الوكيل ملائمًا.

للحفاظ على السرعة والتكلفة المعقولة:

  • نخزّن المطالبات والحوارات الجزئية الشائعة، إلى جانب مجموعة منتقاة من الأمثلة قليلة الأمثلة.

  • يتيح لنا هذا التخزين المؤقت تطبيق مصنّفات النماذج اللغوية الكبيرة (LLM) بسرعة وتكلفة منخفضة، من دون إعادة بناء السياق في كل مرة.

رسم تخطيطي يوضح نهجنا: التصنيف متعدد الطبقات والتخزين المؤقت للمطالبات.

نظرة إلى المستقبل: المصنّفات الدستورية

وصفت دراسة حديثة أجرتها Anthropic «المصنّفات الدستورية»، وهي نظام يعتمد على مصنّفات إضافية مدرّبة وفق قواعد «دستورية» لرصد الطلبات الخبيثة أو غير الآمنة. وأفادت النتائج بما يلي:

  • قدرة عالية على الصمود أمام آلاف الساعات من اختبار تقييم المخاطر البشري.

  • معدلات ضئيلة للرفض المفرط وأعباء حوسبية معتدلة.

نتصور مستقبلًا تستطيع فيه هذه النهج الدستورية استكمال طبقات التصنيف التقليدية أو حتى استبدالها، لتوفر دفاعًا أشمل في مواجهة أساليب تجاوز إجراءات الحماية المتطورة.

الخلاصة: الدروس المستفادة

  1. مرشحات خفيفة تعمل بالتوازي

تمنع طبقات التصنيف الاستفسارات الخبيثة من الوصول إلى النواة التوليدية أصلًا، وتضمن عدم تسليم المخرجات الرديئة.

  1. تجربة المستخدم مهمة

يزداد تقبّل المستخدمين لقيود النظام عندما تكون التحذيرات الممتعة المستوحاة من عالم اللعبة وحالات الرفض الطريفة محور الاهتمام.

  1. لا تتهاون في الاختبار والمراقبة

يساعد إجراء اختبار تقييم المخاطر بانتظام والمراقبة المتكررة لسلوك اللاعبين في رصد الثغرات قبل أن تعرفها قاعدة اللاعبين الأوسع. يمكن بعد ذلك إدراج هذه الثغرات في مطالبات المصنّف قليلة الأمثلة لمنع استغلالها مستقبلًا (تُجرى هذه العملية يدويًا حاليًا، لكن يمكن أتمتتها).

إنشاء أنظمة ذكاء اصطناعي توليدي آمنة وجذابة للمستقبل

سواء أكنت شركة ألعاب أم مصرفًا أم حتى جهة حكومية، فإذا كنت تعتزم تطبيق روبوت محادثة لخدمة العملاء على نطاق واسع، فعليك أن تستهدف في آنٍ واحد جودة تجربة المستخدم والموثوقية.

ننشئ حلولًا موجهة إلى العملاء للمؤسسات والعلامات التجارية التي تتطلب ما يلي:

  1. السلامة هي الأولوية القصوى—روبوتات محادثة تقدم قيمة للمستخدمين وتحميهم بصرامة من المحتوى الضار

  2. حماية السمعة—نصمم طبقات حماية متعددة تصون سمعة العلامة التجارية، حتى إذا حاول المستخدمون دفع النظام إلى ما يتجاوز حدوده

  3. اللوائح تقيّد خياراتك—نواكب أحدث إرشادات الامتثال كي تتمكن من توسيع نطاق حلولك من دون القلق بشأن تعرض تطبيقك لتجاوز إجراءات الحماية

المؤلف

Andrew Liubinas