मुख्य नेव्हिगेशन

उच्च-जोखमीच्या व्यवसायांसाठी सुरक्षित चॅट एजंट तयार करणे

तुमच्या ब्रँडचे प्रतिनिधित्व करणारा चॅटबॉट तयार करताना तो केवळ सुरक्षित असून चालत नाही, तर त्याचा आवाजही अस्सलपणे तुमचाच वाटला पाहिजे.

कार्यकारी सारांश

  • सार्वजनिक वापरासाठी उपलब्ध असलेल्या LLM अनुप्रयोगांमुळे ब्रँडच्या प्रतिष्ठेला आणि आर्थिक स्थितीला धोका निर्माण होऊ शकतो.

  • LLM जेलब्रेक आणि LLMच्या इतर अनपेक्षित वर्तनामुळे होणारी हानी कमी करण्यासाठी आम्ही वर्गीकरण फिल्टरचे अनेक स्तर वापरतो.

  • दररोज 40,000 आणि सतत वाढणारे संदेश हाताळणाऱ्या, मोठ्या प्रमाणावर वापरल्या जाणाऱ्या प्रत्यक्ष अनुप्रयोगात आम्ही हे तंत्र लागू केले आहे.

परिचय

गेल्या वर्षभरात आम्ही एका आघाडीच्या गेम विकसकासोबत भागीदारी करून जनरेटिव्ह AI चॅटबॉट तैनात केला. तो लहान मुलांचाही समावेश असलेल्या खेळाडूंकडून येणारे दररोज सुमारे 40,000 संदेश हाताळतो. वेग, अचूकता, सुरक्षितता आणि मनोरंजन यांचा समतोल राखणे अत्यावश्यक आहे:

तुमच्या ब्रँडचे प्रतिनिधित्व करणारा चॅटबॉट तयार करताना तो केवळ सुरक्षित असून चालत नाही, तर त्याचा आवाजही अस्सलपणे तुमचाच वाटला पाहिजे.

गेम कंपनीच्या बाबतीत, सुरक्षिततेसोबत मनोरंजन आणि वापरकर्त्यांचा उत्साह यांची सांगड घालणे आवश्यक असते, विशेषतः लहान वयाच्या प्रेक्षकांसाठी.

आधुनिक जनरेटिव्ह AI अनुप्रयोगांचा आधार असलेले LLM अत्यंत लवचिक असतात. त्यामुळे ते अनेक समस्यांवर प्रभावीपणे लागू होतात, पण त्यांच्यावर पुरेशी बंधनेही नसतात. त्यामुळे ते अनेकदा ठरवलेल्या मार्गापासून भरकटून विविध प्रकारचा मजकूर देऊ शकतात, ज्यातील काही मजकूर अयोग्य असू शकतो.

LLM थेट लोकांसाठी उपलब्ध केल्यास अनपेक्षित वर्तन निश्चितच घडेल आणि योग्य प्रतिबंधक उपाय नसल्यास पुढील धोके उद्भवू शकतात:

वास्तविक जगातील धोक्यांची एक झलक.

LLMच्या अनपेक्षित वापरासंबंधी बातम्यांमधील मथळे:

जनरेटिव्ह AI प्रणालींमध्ये सुरक्षितता निर्माण करणे आणि ती कायम राखणे ऐच्छिक का नाही, हे या घटनांमधून अधोरेखित होते. लहान मुलांचा संबंध असेल तेव्हा हे विशेषतः महत्त्वाचे ठरते. केवळ अस्वीकरणांवर अवलंबून राहता येत नाही. मजकूर योग्य ठेवण्यासाठी भक्कम सुरक्षा-नियंत्रणे अत्यावश्यक आहेत.

आमचा दृष्टिकोन: स्तरित वर्गीकरण आणि प्रॉम्प्टचे तात्पुरते संचयन

ग्राहकांसाठी तयार केलेल्या RAG (माहिती पुनर्प्राप्ती-संवर्धित निर्मिती) प्रणालींप्रमाणेच, उच्च कार्यक्षमता कायम राखून जेलब्रेकिंगचे धोके कमी करण्यासाठी आम्ही अनेक AI घटकांचा वापर करतो.

आमचा दृष्टिकोन दर्शवणारा आकृतीबंध: स्तरित वर्गीकरण आणि प्रॉम्प्टचे तात्पुरते संचयन.

आमच्या प्रणालीच्या रचनेचा सोपा आराखडा

प्रणालीची सुरक्षितता सुनिश्चित करण्यासाठी आम्ही इनपुट आणि आउटपुट या दोन्हींवर LLM वर्गीकारक वापरतो:

  1. इनपुट वर्गीकरण (एकाच वेळी कार्यरत)

  • वापरकर्त्यांच्या प्रश्नांना खूणचिठ्ठ्या लावण्यासाठी आम्ही LLM स्ट्रक्चर्ड आउटपुट्ससोबत Pydantic संरचना वापरल्या. उदाहरणार्थ, SAFE, SUSPICIOUS, CHILD_HARM_RISK आणि VIOLENT. यात जेलब्रेकिंग किंवा प्रतिबंधित वर्तन ओळखण्यासाठी सूचक खूणांचाही समावेश होता.

  • प्रत्येक विषयासाठी स्वतंत्र असे अनेक वर्गीकारक वापरल्यामुळे सर्व काही हाताळणाऱ्या एका मोठ्या वर्गीकारकापेक्षा लक्षणीयरीत्या चांगली कामगिरी मिळाली.

  • “या पात्राकडून मला सतत मारले जाते” हे गेमच्या संदर्भातील विधान आणि “माझे पालक मला इजा करत आहेत” हे बालहानीचे निदर्शक विधान यांतील फरक वर्गीकारकांनी ओळखावा यासाठी फ्यू-शॉटची अनेक उदाहरणे अत्यंत महत्त्वाची ठरली.

  • ग्राहक आणि त्यांच्या विशेष विश्वास व सुरक्षितता पथकांसोबत जवळून सहकार्य केल्यामुळे आमचे वर्गीकारक उच्च-जोखमीच्या संदेशांचे मूल्यमापन वास्तवात ते जसे करतील, त्याच प्रकारे करू शकले.

आमचा दृष्टिकोन दर्शवणारा आकृतीबंध: स्तरित वर्गीकरण आणि प्रॉम्प्टचे तात्पुरते संचयन.

  1. प्रतिसाद निर्मिती

  • इनपुट सुरक्षित असल्याचे ठरल्यास मुख्य LLM प्रतिसाद तयार करतो.

  • अन्यथा, जेलब्रेक असल्यास संदेशाकडे दुर्लक्ष करता येते किंवा प्रश्नातून सुरक्षिततेची समस्या सूचित झाल्यास तो मानवी कर्मचाऱ्याकडे पाठवता येतो.

  1. आउटपुट वर्गीकरण

  • अंतिम प्रतिसाद देण्यापूर्वी आणि तो आमच्या अनुप्रयोगाबाहेर जाण्याआधी आम्ही मॉडेलच्या प्रतिसादाचे वर्गीकरण करतो.

  • काही प्रतिसादांमध्ये इंटरनेटवरून गोळा केलेल्या डेटावर RAG तंत्रे वापरली जाऊ शकतात. त्यामुळे ही पायरी आम्हाला डेटा-विषबाधेपासून संरक्षण देते.

  • प्रतिसादात प्रतिबंधित मजकूर असल्यास प्रणाली हस्तक्षेप करून त्याऐवजी सर्वसाधारण संदेश देते. प्रत्यक्षात असे क्वचितच घडले आहे. तरीही एजंटचे वर्तन योग्य राहावे यासाठी हा खबरदारीचा अतिरिक्त स्तर आहे.

वेग आणि परवडणारी किंमत कायम राखण्यासाठी:

  • आम्ही वारंवार वापरले जाणारे प्रॉम्प्ट, अंशतः झालेले संवाद आणि काळजीपूर्वक निवडलेली फ्यू-शॉट उदाहरणे साठवतो.

  • या तात्पुरत्या संचयनामुळे प्रत्येक वेळी संदर्भ नव्याने तयार न करता LLM वर्गीकारक जलद आणि कमी खर्चात वापरता येतात.

आमचा दृष्टिकोन दर्शवणारा आकृतीबंध: स्तरित वर्गीकरण आणि प्रॉम्प्टचे तात्पुरते संचयन.

भविष्याचा वेध: घटनात्मक वर्गीकारक

Anthropicच्या अलीकडील अभ्यासात घटनात्मक वर्गीकारकांचे वर्णन केले आहे. ही प्रणाली दुर्भावनापूर्ण किंवा असुरक्षित विनंत्या शोधण्यासाठी “घटनात्मक” नियमांनुसार प्रशिक्षित केलेल्या अतिरिक्त वर्गीकारकांवर अवलंबून असते. त्यांनी पुढील निष्कर्ष नोंदवले:

  • मानवी तज्ज्ञांनी हजारो तास केलेल्या रेड टीमिंगला तोंड देण्याची उच्च क्षमता.

  • अनावश्यक नकाराचे अत्यल्प प्रमाण आणि संगणकीय प्रक्रियेचा मध्यम अतिरिक्त भार.

भविष्यात हे घटनात्मक दृष्टिकोन पारंपरिक वर्गीकरण स्तरांना पूरक ठरू शकतात किंवा त्यांची जागाही घेऊ शकतात. त्यामुळे बदलत्या जेलब्रेकिंग डावपेचांविरुद्ध अधिक व्यापक संरक्षण मिळेल.

सारांश: आम्ही घेतलेले धडे

  1. समांतर आणि हलके फिल्टर

वर्गीकरण स्तर दुर्भावनापूर्ण प्रश्नांना निर्मिती करणाऱ्या मुख्य भागापर्यंत पोहोचण्यापासून रोखतात आणि निकृष्ट आउटपुट वापरकर्त्यांपर्यंत पोहोचणार नाहीत याची खात्री करतात.

  1. वापरकर्ता अनुभव महत्त्वाचा आहे

मनोरंजक, कथाविश्वाशी सुसंगत इशारे आणि खेळकर नकार दिल्यास वापरकर्ते प्रणालीची बंधने स्वीकारण्यास अधिक तयार होतात.

  1. चाचणी आणि देखरेखीत कोणतीही तडजोड करू नका

नियमित रेड टीमिंग आणि खेळाडूंच्या वर्तनाची वारंवार देखरेख केल्याने व्यापक खेळाडू समुदायाला असुरक्षितता समजण्यापूर्वीच ती शोधता येते. त्यानंतर या बाबी फ्यू-शॉट वर्गीकारकांच्या प्रॉम्प्टमध्ये समाविष्ट करून भविष्यात त्यांचा गैरवापर रोखता येतो. सध्या ही प्रक्रिया हाताने केली जाते, पण ती स्वयंचलित करता येईल.

उद्यासाठी सुरक्षित आणि आकर्षक जनरेटिव्ह AI प्रणाली तयार करणे

तुम्ही गेम कंपनी, बँक किंवा सरकारी विभाग असलात, तरी मोठ्या प्रमाणावर ग्राहकसेवा चॅटबॉट लागू करताना वापरकर्ता-केंद्रित रचना आणि विश्वासार्हता ही दोन्ही उद्दिष्टे साध्य करणे आवश्यक आहे.

आम्ही पुढील गरजा असलेल्या संस्था आणि ब्रँडसाठी ग्राहकांसमोरील उपाय तयार करतो:

  1. सुरक्षिततेला सर्वोच्च प्राधान्य आहे—वापरकर्त्यांना मूल्य देतानाच हानिकारक मजकुरापासून त्यांचे काटेकोर संरक्षण करणारे चॅटबॉट.

  2. प्रतिष्ठेचे संरक्षण केले जाते—वापरकर्त्यांनी प्रणालीला तिच्या मर्यादेपलीकडे नेण्याचा प्रयत्न केला, तरी ब्रँडची प्रतिष्ठा अबाधित ठेवणारे संरक्षणाचे अनेक स्तर आम्ही तयार करतो.

  3. नियमांमुळे तुमचे पर्याय मर्यादित होतात—अनुप्रयोग जेलब्रेक होण्याची चिंता न करता तुम्हाला उपायांचा विस्तार करता यावा म्हणून आम्ही अनुपालनाच्या नवीनतम मार्गदर्शक तत्त्वांवर सतत लक्ष ठेवतो.

लेखक

Andrew Liubinas