सार्वजनिक वापरासाठी उपलब्ध असलेल्या LLM अनुप्रयोगांमुळे ब्रँडच्या प्रतिष्ठेला आणि आर्थिक स्थितीला धोका निर्माण होऊ शकतो.
LLM जेलब्रेक आणि LLMच्या इतर अनपेक्षित वर्तनामुळे होणारी हानी कमी करण्यासाठी आम्ही वर्गीकरण फिल्टरचे अनेक स्तर वापरतो.
दररोज 40,000 आणि सतत वाढणारे संदेश हाताळणाऱ्या, मोठ्या प्रमाणावर वापरल्या जाणाऱ्या प्रत्यक्ष अनुप्रयोगात आम्ही हे तंत्र लागू केले आहे.
गेल्या वर्षभरात आम्ही एका आघाडीच्या गेम विकसकासोबत भागीदारी करून जनरेटिव्ह AI चॅटबॉट तैनात केला. तो लहान मुलांचाही समावेश असलेल्या खेळाडूंकडून येणारे दररोज सुमारे 40,000 संदेश हाताळतो. वेग, अचूकता, सुरक्षितता आणि मनोरंजन यांचा समतोल राखणे अत्यावश्यक आहे:
तुमच्या ब्रँडचे प्रतिनिधित्व करणारा चॅटबॉट तयार करताना तो केवळ सुरक्षित असून चालत नाही, तर त्याचा आवाजही अस्सलपणे तुमचाच वाटला पाहिजे.
गेम कंपनीच्या बाबतीत, सुरक्षिततेसोबत मनोरंजन आणि वापरकर्त्यांचा उत्साह यांची सांगड घालणे आवश्यक असते, विशेषतः लहान वयाच्या प्रेक्षकांसाठी.
आधुनिक जनरेटिव्ह AI अनुप्रयोगांचा आधार असलेले LLM अत्यंत लवचिक असतात. त्यामुळे ते अनेक समस्यांवर प्रभावीपणे लागू होतात, पण त्यांच्यावर पुरेशी बंधनेही नसतात. त्यामुळे ते अनेकदा ठरवलेल्या मार्गापासून भरकटून विविध प्रकारचा मजकूर देऊ शकतात, ज्यातील काही मजकूर अयोग्य असू शकतो.
LLM थेट लोकांसाठी उपलब्ध केल्यास अनपेक्षित वर्तन निश्चितच घडेल आणि योग्य प्रतिबंधक उपाय नसल्यास पुढील धोके उद्भवू शकतात:
“जेलब्रेक”, ज्यात वापरकर्ते चॅटबॉटला हानिकारक किंवा प्रतिबंधित मजकूर तयार करण्यास जाणीवपूर्वक भाग पाडतात. एक मजेशीर माहिती: LLM जेलब्रेकिंग खेळाच्या रूपात अनुभवण्यासाठी कोणीही या संकेतस्थळाला भेट देऊ शकते.; किंवा
अनवधानाने अभिरुचीहीन, आक्षेपार्ह किंवा धोकादायक मजकूर देणे. अनेक प्रकरणांत यामुळे वापरकर्त्याच्या आरोग्याला धोका निर्माण होऊ शकतो किंवा अनुप्रयोग पुरवठादाराचे आर्थिक नुकसान अथवा ब्रँडची हानी होऊ शकते.
LLMच्या अनपेक्षित वापरासंबंधी बातम्यांमधील मथळे:
जनरेटिव्ह AI प्रणालींमध्ये सुरक्षितता निर्माण करणे आणि ती कायम राखणे ऐच्छिक का नाही, हे या घटनांमधून अधोरेखित होते. लहान मुलांचा संबंध असेल तेव्हा हे विशेषतः महत्त्वाचे ठरते. केवळ अस्वीकरणांवर अवलंबून राहता येत नाही. मजकूर योग्य ठेवण्यासाठी भक्कम सुरक्षा-नियंत्रणे अत्यावश्यक आहेत.
ग्राहकांसाठी तयार केलेल्या RAG (माहिती पुनर्प्राप्ती-संवर्धित निर्मिती) प्रणालींप्रमाणेच, उच्च कार्यक्षमता कायम राखून जेलब्रेकिंगचे धोके कमी करण्यासाठी आम्ही अनेक AI घटकांचा वापर करतो.


आमच्या प्रणालीच्या रचनेचा सोपा आराखडा
प्रणालीची सुरक्षितता सुनिश्चित करण्यासाठी आम्ही इनपुट आणि आउटपुट या दोन्हींवर LLM वर्गीकारक वापरतो:
इनपुट वर्गीकरण (एकाच वेळी कार्यरत)
वापरकर्त्यांच्या प्रश्नांना खूणचिठ्ठ्या लावण्यासाठी आम्ही LLM स्ट्रक्चर्ड आउटपुट्ससोबत Pydantic संरचना वापरल्या. उदाहरणार्थ, SAFE, SUSPICIOUS, CHILD_HARM_RISK आणि VIOLENT. यात जेलब्रेकिंग किंवा प्रतिबंधित वर्तन ओळखण्यासाठी सूचक खूणांचाही समावेश होता.
प्रत्येक विषयासाठी स्वतंत्र असे अनेक वर्गीकारक वापरल्यामुळे सर्व काही हाताळणाऱ्या एका मोठ्या वर्गीकारकापेक्षा लक्षणीयरीत्या चांगली कामगिरी मिळाली.
“या पात्राकडून मला सतत मारले जाते” हे गेमच्या संदर्भातील विधान आणि “माझे पालक मला इजा करत आहेत” हे बालहानीचे निदर्शक विधान यांतील फरक वर्गीकारकांनी ओळखावा यासाठी फ्यू-शॉटची अनेक उदाहरणे अत्यंत महत्त्वाची ठरली.
ग्राहक आणि त्यांच्या विशेष विश्वास व सुरक्षितता पथकांसोबत जवळून सहकार्य केल्यामुळे आमचे वर्गीकारक उच्च-जोखमीच्या संदेशांचे मूल्यमापन वास्तवात ते जसे करतील, त्याच प्रकारे करू शकले.


प्रतिसाद निर्मिती
इनपुट सुरक्षित असल्याचे ठरल्यास मुख्य LLM प्रतिसाद तयार करतो.
अन्यथा, जेलब्रेक असल्यास संदेशाकडे दुर्लक्ष करता येते किंवा प्रश्नातून सुरक्षिततेची समस्या सूचित झाल्यास तो मानवी कर्मचाऱ्याकडे पाठवता येतो.
आउटपुट वर्गीकरण
अंतिम प्रतिसाद देण्यापूर्वी आणि तो आमच्या अनुप्रयोगाबाहेर जाण्याआधी आम्ही मॉडेलच्या प्रतिसादाचे वर्गीकरण करतो.
काही प्रतिसादांमध्ये इंटरनेटवरून गोळा केलेल्या डेटावर RAG तंत्रे वापरली जाऊ शकतात. त्यामुळे ही पायरी आम्हाला डेटा-विषबाधेपासून संरक्षण देते.
प्रतिसादात प्रतिबंधित मजकूर असल्यास प्रणाली हस्तक्षेप करून त्याऐवजी सर्वसाधारण संदेश देते. प्रत्यक्षात असे क्वचितच घडले आहे. तरीही एजंटचे वर्तन योग्य राहावे यासाठी हा खबरदारीचा अतिरिक्त स्तर आहे.
वेग आणि परवडणारी किंमत कायम राखण्यासाठी:
आम्ही वारंवार वापरले जाणारे प्रॉम्प्ट, अंशतः झालेले संवाद आणि काळजीपूर्वक निवडलेली फ्यू-शॉट उदाहरणे साठवतो.
या तात्पुरत्या संचयनामुळे प्रत्येक वेळी संदर्भ नव्याने तयार न करता LLM वर्गीकारक जलद आणि कमी खर्चात वापरता येतात.


Anthropicच्या अलीकडील अभ्यासात घटनात्मक वर्गीकारकांचे वर्णन केले आहे. ही प्रणाली दुर्भावनापूर्ण किंवा असुरक्षित विनंत्या शोधण्यासाठी “घटनात्मक” नियमांनुसार प्रशिक्षित केलेल्या अतिरिक्त वर्गीकारकांवर अवलंबून असते. त्यांनी पुढील निष्कर्ष नोंदवले:
मानवी तज्ज्ञांनी हजारो तास केलेल्या रेड टीमिंगला तोंड देण्याची उच्च क्षमता.
अनावश्यक नकाराचे अत्यल्प प्रमाण आणि संगणकीय प्रक्रियेचा मध्यम अतिरिक्त भार.
भविष्यात हे घटनात्मक दृष्टिकोन पारंपरिक वर्गीकरण स्तरांना पूरक ठरू शकतात किंवा त्यांची जागाही घेऊ शकतात. त्यामुळे बदलत्या जेलब्रेकिंग डावपेचांविरुद्ध अधिक व्यापक संरक्षण मिळेल.
समांतर आणि हलके फिल्टर
वर्गीकरण स्तर दुर्भावनापूर्ण प्रश्नांना निर्मिती करणाऱ्या मुख्य भागापर्यंत पोहोचण्यापासून रोखतात आणि निकृष्ट आउटपुट वापरकर्त्यांपर्यंत पोहोचणार नाहीत याची खात्री करतात.
वापरकर्ता अनुभव महत्त्वाचा आहे
मनोरंजक, कथाविश्वाशी सुसंगत इशारे आणि खेळकर नकार दिल्यास वापरकर्ते प्रणालीची बंधने स्वीकारण्यास अधिक तयार होतात.
चाचणी आणि देखरेखीत कोणतीही तडजोड करू नका
नियमित रेड टीमिंग आणि खेळाडूंच्या वर्तनाची वारंवार देखरेख केल्याने व्यापक खेळाडू समुदायाला असुरक्षितता समजण्यापूर्वीच ती शोधता येते. त्यानंतर या बाबी फ्यू-शॉट वर्गीकारकांच्या प्रॉम्प्टमध्ये समाविष्ट करून भविष्यात त्यांचा गैरवापर रोखता येतो. सध्या ही प्रक्रिया हाताने केली जाते, पण ती स्वयंचलित करता येईल.
तुम्ही गेम कंपनी, बँक किंवा सरकारी विभाग असलात, तरी मोठ्या प्रमाणावर ग्राहकसेवा चॅटबॉट लागू करताना वापरकर्ता-केंद्रित रचना आणि विश्वासार्हता ही दोन्ही उद्दिष्टे साध्य करणे आवश्यक आहे.
आम्ही पुढील गरजा असलेल्या संस्था आणि ब्रँडसाठी ग्राहकांसमोरील उपाय तयार करतो:
सुरक्षिततेला सर्वोच्च प्राधान्य आहे—वापरकर्त्यांना मूल्य देतानाच हानिकारक मजकुरापासून त्यांचे काटेकोर संरक्षण करणारे चॅटबॉट.
प्रतिष्ठेचे संरक्षण केले जाते—वापरकर्त्यांनी प्रणालीला तिच्या मर्यादेपलीकडे नेण्याचा प्रयत्न केला, तरी ब्रँडची प्रतिष्ठा अबाधित ठेवणारे संरक्षणाचे अनेक स्तर आम्ही तयार करतो.
नियमांमुळे तुमचे पर्याय मर्यादित होतात—अनुप्रयोग जेलब्रेक होण्याची चिंता न करता तुम्हाला उपायांचा विस्तार करता यावा म्हणून आम्ही अनुपालनाच्या नवीनतम मार्गदर्शक तत्त्वांवर सतत लक्ष ठेवतो.