मुख्य नेव्हिगेशन

OpenAI च्या gpt-oss-safeguard मॉडेलचा कृत्रिम बुद्धिमत्ता सुरक्षिततेवरील प्रभाव

OpenAI च्या gpt-oss-safeguard मॉडेलचे प्रारंभिक मूल्यमापन विशेषीकृत सुरक्षा मॉडेल उत्पादनातील कृत्रिम बुद्धिमत्ता प्रणाली कशा मजबूत करतात हे दाखवते.

गेल्या दोन वर्षांत आम्ही सुरक्षितपणे विस्तारून लाखो वापरकर्त्यांपर्यंत पोहोचलेले उपाय तयार केले आहेत. वेगवान आणि अचूक मॉडरेशन प्रणालींची रचना हा या कामाचा महत्त्वाचा भाग आहे. प्रभावी मॉडरेशनमुळे कंपन्या अत्याधुनिक कृत्रिम बुद्धिमत्ता उपाय आत्मविश्वासाने कार्यान्वित करू शकतात. अनावश्यक निर्मिती समस्या होण्यापूर्वीच शोधून ते अंतिम वापरकर्त्यांना हानीपासून वाचवते आणि ब्रँडची सुरक्षितता सुनिश्चित करते.

अलीकडेच OpenAI ने आपली GPT-OSS-Safeguard मॉडेल प्रकाशित केली. ही या वर्षाच्या सुरुवातीला सादर केलेल्या 20B आणि 120B OSS मॉडेलची फाइन-ट्यून केलेली रूपे आहेत. ही मॉडेल अनुमानाच्या वेळी वापरकर्त्याच्या धोरणाचा थेट अर्थ लावू शकतात, त्यामुळे आशय मॉडरेशनसाठी लवचीक आणि प्रभावी पद्धत मिळते. ही मॉडेल सध्या संशोधनपूर्वावलोकनात आहेत, त्यामुळे काळानुसार त्यांत निश्चितच सुधारणा होत राहतील.

हे मॉडेल प्रकाशित होण्यापूर्वी आम्ही OpenAI सोबत सहकार्य केले आणि मॉडेलच्या विकासाला दिशा देण्यासाठी प्रत्यक्ष वापरातील मूल्यमापने केली. या लेखात आम्ही त्या सहकार्यातून मिळालेले निष्कर्ष मांडतो आणि या प्रगतीचा उत्पादनातील कृत्रिम बुद्धिमत्ता प्रणालींच्या मॉडरेशनच्या भविष्यावर काय परिणाम होईल, याचा आढावा घेतो.

आज उत्पादनात मॉडरेशन कसे कार्य करते?

आज मॉडरेशन उपाय सहसा अनुप्रयोगाभोवती उभारलेल्या सुरक्षेच्या अनेक स्तरांचे रूप घेतात. मोठ्या प्रमाणावर वापरल्या जाणाऱ्या सार्वजनिक प्रणालींमध्ये आम्ही ही रचना वारंवार वापरतो. अधिक सविस्तर माहितीसाठी यावरील आमचा ब्लॉग येथे वाचा.

  1. इनपुटचे समांतर वर्गीकरण करा, म्हणजे हानिकारक प्रॉम्प्ट आत येणार नाहीत: प्रत्येक वापरकर्ता संदेशाला लेबल लावण्यासाठी लहान, विषयविशिष्ट वर्गीकारक एकाच वेळी चालतात. आमच्या निरीक्षणानुसार, मर्यादित विषयावर लक्ष केंद्रित करणारे वर्गीकारक एका सर्वसमावेशक वर्गीकारकापेक्षा मोजता येईल इतके अधिक विश्वासार्ह असतात. प्रॉम्प्टमध्ये काळजीपूर्वक निवडलेली फ्यू-शॉट उदाहरणे “हा प्रमुख शत्रू मला सतत मारतो” (खेळातील संदर्भ, पूर्णपणे निरुपद्रवी) आणि प्रत्यक्ष जगातील हानीचा संकेत यांतील फरक ओळखण्यास मदत करतात.

    • सुरक्षित → नेहमीप्रमाणे उत्तर तयार करा

    • जेलब्रेक → दुर्लक्ष करा किंवा ब्रँडच्या शैलीतील नकार देऊन विषय वळवा

    • सुरक्षितता किंवा कल्याणाशी संबंधित धोके → सविस्तर संदर्भासह मानवी तज्ज्ञाकडे पाठवा

  2. आउटपुटचे वर्गीकरण करा, म्हणजे चुकीचे उत्तर पाठवले जाणार नाही: प्रत्येक संभाव्य उत्तर पाठवण्यापूर्वी पुन्हा तपासले जाते. यामुळे मॉडेलच्या वर्तनातील बदल, पुनर्प्राप्ती-संवर्धित निर्मितीच्या डेटातील विषबाधा आणि हानिकारक आशय, वैयक्तिक ओळख पटवणारी माहिती उघड होणे किंवा संवेदनशील माहिती गळणे यांसारख्या सूक्ष्म धोरणात्मक अपवादांपासून संरक्षण मिळते. उत्तर धोकादायक म्हणून चिन्हांकित झाल्यास, नंतर पश्चात्ताप होईल असे काही पाठवण्याऐवजी आम्ही LLM ने तयार केलेले उत्तर सुरक्षित, ब्रँडशी सुसंगत संदेशाने बदलतो किंवा ते मानवी तज्ज्ञाकडे पाठवतो.

  3. प्रणाली वेगवान आणि परवडणारी ठेवा: प्रॉम्प्टचे पुनर्वापरयोग्य घटक तयार केल्यास प्रॉम्प्टचे तुकडे, वर्गीकारकाची फ्यू-शॉट उदाहरणे आणि संवादाचे सामान्य प्रारंभिक भाग तात्पुरते साठवता येतात. या पद्धतीमुळे तुमच्या सुरक्षा उपायांचा विलंब आणि खर्च दोन्ही कमी होतात.

  4. सुरक्षिततेला उत्पादनाच्या अनुभवाचा भाग मानानकार आणि इशारे ब्रँडच्या शैलीत लिहिले जातात, उदा. खेळांसाठी खेळकर आणि वित्तक्षेत्रासाठी औपचारिक. वापरकर्ता अनुभव वापरकर्त्याच्या हेतूचा आदर करतो, तेव्हा सुरक्षा उपायांची स्वीकारार्हता वाढते आणि जेलब्रेकचे प्रयत्न कमी होतात.

  5. निरीक्षण करा, रेड टीमिंग करा आणि अभिप्रायचक्र पूर्ण करासततचे रेड टीमिंग आणि प्रत्यक्ष सुरक्षा दर्शकफलक वापरकर्त्यांवर परिणाम होण्यापूर्वीच कामगिरीतील घसरण शोधण्यास मदत करतात. अतिरिक्त फ्यू-शॉट उदाहरणे किंवा मार्गनिर्धारण नियम देऊन आम्ही मॉडेलला नवे हल्ल्याचे नमुने शिकवू शकतो. त्यामुळे अनुप्रयोगाच्या कामगिरीशी तडजोड न करता कालांतराने प्रणाली भेदणे अधिक कठीण होते.

आज मॉडरेशन उपाय तयार करतानाची आव्हाने

प्रभावी सुरक्षा उपाय तयार करणे आणि त्यांची देखभाल करणे कठीण आहे.

प्रत्यक्षात सुस्पष्ट धोरण तयार करण्यासाठी प्रमुख व्यावसायिक भागधारक आणि विकासक यांच्यात काळजीपूर्वक सहकार्य आवश्यक असते. धोरण निश्चित झाल्यानंतर प्रणालीची रचना आणि वर्तन तयार करून ट्यून करावे लागते.

gpt-oss-safeguard सारख्या खुल्या सुरक्षा रीझनिंग मॉडेलच्या आगमनामुळे या प्रक्रियेतील काही अडचणी दूर होऊ शकतात आणि आशय मॉडरेशनसाठी अधिक तयार व बहुपयोगी पाया मिळू शकतो.

विशेषीकृत सुरक्षा मॉडेलची क्षमता

आजच्या मॉडरेशन प्रणाली तयार करताना येणाऱ्या काही सामान्य आव्हानांवर उपाय देणे हे gpt-oss-safeguard चे उद्दिष्ट आहे. ही लहान, विशेषीकृत मॉडेल अनुमानाच्या वेळी लक्ष्यित धोरणावर रीझनिंग करण्यासाठी फाइन-ट्यून केलेली आहेत. ती जेलब्रेक, वैयक्तिक ओळख पटवणारी माहिती उघड होणे आणि इतर धोरणभंग यांसारखा हानिकारक किंवा संवेदनशील आशय शोधतात.

वर्गीकरण प्रक्रियेत रीझनिंग समाविष्ट केल्यामुळे ती अधिक अचूक, टिकाऊ आणि सहजपणे चुकवता न येणारे मॉडरेशन देतात. GPT-OSS 20B आणि 120B ची विशेषीकृत सुरक्षा रूपे असल्यामुळे ती सानुकूल धोरणांच्या व्याख्यांद्वारे अत्यल्प उभारणी खर्चात अत्याधुनिक सुरक्षा कामगिरी देतात.

आम्ही काय तपासले

आम्ही उत्पादनसदृश विविध कामांसाठी gpt-oss-safeguard 20B आणि 120B चे मूल्यमापन केले: प्रत्यक्ष-वेळ ध्वनी सहाय्यक, खेळातील खेळाडू-सहाय्यक संवादयंत्र, सक्रिय संवाद मॉडरेशन प्रणाली आणि बहुभाषिक विषारी आशय तपासणी (स्पॅनिश, फ्रेंच, इटालियन, पोर्तुगीज, रशियन आणि तुर्की).

आम्हाला काय आढळले

  • विलंबाबाबत संवेदनशील ध्वनी मॉडरेशन: आमच्या प्रत्यक्ष-वेळ ध्वनी चाचण्यांमध्ये, म्हणजे संभाषण सुरू असताना उत्तराचे विश्लेषण व प्राधान्यक्रम ठरवणे आवश्यक असलेल्या खेळातील संवाद मॉडरेशनसारख्या परिस्थितीत, gpt-oss-safeguard-20B ने GPT-OSS-20B आणि GPT-5-Mini यांच्यातील अचूकतेची सुमारे 80% तफावत भरून काढली (0.45 वरून 0.71 विरुद्ध 0.78), तेही खूप कमी विलंबात.

  • खेळाडू सहाय्याचे अग्रेषण: खेळाडू-सहाय्याच्या प्राधान्यक्रम निर्धारणात gpt-oss-safeguard-20B ने GPT-OSS-20b ते GPT-5-Mini मधील सुमारे 90% तफावत भरून काढली (0.57 वरून 0.66 विरुद्ध 0.67). याने चाचणीसंचातील सर्वोत्तम समग्र अचूकता, निरुपद्रवी आशयावर 88% पुनःप्राप्ती आणि असुरक्षित वापरकर्ता शोधण्यात 87% अचूकता दिली. मानवी पुनरावलोकनकर्त्यांवर भार न टाकता सावध आणि अत्यंत विश्वासार्ह अग्रेषण हवे असल्यास हे उपयुक्त ठरते.

  • मोठ्या प्रमाणावरील धोरण-सघन संवाद मॉडरेशन: सविस्तर धोरण दस्तऐवजानुसार खेळातील संदेश सक्रियपणे चिन्हांकित करावे लागणाऱ्या आमच्या सर्वाधिक कठीण मूल्यमापनात gpt-oss-safeguard ने OSS मूलभूत मॉडेलपेक्षा स्पष्टपणे चांगली कामगिरी केली. याने सुमारे 35% सापेक्ष वाढ साधली आणि दीर्घ धोरणेही प्रभावीपणे हाताळली. हे अत्यंत संवेदनशील वापरप्रकरण असून त्यासाठी उच्च पुनःप्राप्ती आणि अचूकता आवश्यक आहे. पुनःप्राप्ती खूप कमी असल्यास अनेक हानिकारक संदेश सुटतील. अचूकता कमी असल्यास अनेक असंबंधित संदेश मानवी मॉडरेटरकडे पाठवले जातील आणि खरोखर कठीण प्रकरणांवरील त्यांचे लक्ष विचलित होईल.

  • बहुभाषिक कामगिरी: सहा भाषांतील संतुलित विषारी आशय डेटासंचावर gpt-oss-safeguard ची कामगिरी GPT-5-Mini च्या जवळपास होती. अचूकतेतील फरक सहसा 3 ते 5 टक्के-बिंदू होता आणि स्पॅनिशमध्ये gpt-oss-safeguard-120B किंचित पुढे होते. तुर्कीसारख्या कमी संसाधने असलेल्या भाषांमध्ये आम्हाला किंचित मोठी तफावत दिसली. मात्र एकूणच बहुभाषिक कामगिरी भक्कम होती आणि 20B वरून 120B कडे गेल्यावर पुनःप्राप्तीत सातत्यपूर्ण वाढ दिसली.

मॉडरेशनमध्ये LLM पारंपरिकरीत्या कमकुवत ठरतात अशा क्षेत्रांतही gpt-oss-safeguard मॉडेलची कामगिरी चांगली असल्याचे आम्ही पाहिले. उदाहरणार्थ, वैयक्तिक ओळख पटवणाऱ्या माहितीबाबत मुख्य प्रवाहातील मॉडेल अमेरिकन पद्धतीची माहिती ओळखण्याकडे अधिक झुकतात आणि इतर भौगोलिक प्रदेशांत त्यांची कामगिरी कमकुवत असते. त्यामुळे व्यापक LLM हाताळू शकत नाहीत अशा किरकोळ धोरणभंगांचा शोध घेण्यासाठी सानुकूल साधनांवरील अवलंबित्व कमी करून मॉडरेशनची उभारणी सुलभ करण्यात gpt-oss-safeguard उपयुक्त ठरेल, असे आम्हाला वाटते.

लक्ष्यित फाइन-ट्यूनिंगची ताकद

आमच्या मूल्यमापनांवरून हे सिद्ध झाले आहे की gpt-oss-safeguard-20B आणि gpt-oss-safeguard-120B यांसारखी “मूलभूत मॉडरेशन मॉडेल” तुम्हाला कमी वेळात मोठी मजल गाठून देतील. मात्र, प्रणालींना सुरक्षितता आणि विशिष्टतेचे सर्वोच्च निकष पूर्ण करायचे असतील, तर विशिष्ट क्षेत्रासाठी फाइन-ट्यून केलेली मॉडेल अजूनही सर्वोत्तम ठरतात.

लक्ष्यित फाइन-ट्यूनिंगची ताकद दाखवणारा स्क्रीनशॉट.

खेळातील मॉडरेशनच्या वापरासाठी आम्ही सुमारे 10 हजार ऐतिहासिक मॉडरेटर कृती आणि धोरणात्मक परिणामांवर सुपरवाइझ्ड फाइन-ट्यूनिंग वापरून Qwen3-0.6B वर्गीकारक फाइन-ट्यून केला. या कामासाठी आम्ही तपासलेल्या प्रत्येक मूलभूत मॉडेलपेक्षा या मॉडेलची कामगिरी लक्षणीयरीत्या चांगली आहे. याने 15% च्या तुलनेत 57% अचूकता गाठली (gpt-oss-safeguard-120B; GPT-4.1-nano च्या कामगिरीच्या गुणोत्तरावरून अंदाजित), म्हणजे 42 टक्के-बिंदू किंवा सुमारे 280% वाढ. लेबल केलेल्या उदाहरणांवर प्रशिक्षित केलेले लहान, समर्पित वर्गीकारक विशिष्ट क्षेत्रांत सुरक्षा मॉडेलपेक्षा सरस ठरू शकतात, या OpenAI च्या मार्गदर्शनाशी हे परिणाम सुसंगत आहेत.

निष्कर्ष स्पष्ट आहे: धोरणांमध्ये बारकावे आणि अपवादात्मक प्रकरणे भरपूर असतील, तेव्हा त्या क्षेत्रासाठी ट्यून केलेले लहान मॉडेलच सर्वोत्तम मानक ठरते. फाइन-ट्यूनिंगमुळे तुमचे धोरण आणि अपवादात्मक प्रकरणे थेट मापदंडांमध्ये समाविष्ट होतात. त्यामुळे प्रत्यक्ष वापरातील गुंतागुंतीच्या परिस्थितीत वर्तन अधिक स्थिर राहते आणि विलंब व खर्चही अत्यल्प असतो.

यासाठी सुपरवाइझ्ड फाइन-ट्यूनिंग हा अनेक संभाव्य मार्गांपैकी फक्त एक मार्ग आहे. मॉडेलचे वर्तन आणखी अनुकूल करण्यासाठी रीइन्फोर्समेंट लर्निंग किंवा प्रत्यक्ष धोरणाधारित ज्ञान-संक्षेपण यांसारखी इतर प्रभावी प्रशिक्षण तंत्रेही वापरता येतात.

फाइन-ट्यूनिंगची मर्यादा

फाइन-ट्यूनिंगसाठी सहसा मोठ्या प्रमाणात डेटाची गरज असते. हा Qwen3-0.6B वर्गीकारक फाइन-ट्यून करण्यासाठी वापरलेल्या डेटासंचाला मानवी मॉडरेटरनी स्वतः लेबल केले होते. त्यामुळे तो स्वच्छ आणि अत्यंत विश्वसनीय सत्यस्रोत होता.

अनेक प्रकल्पांच्या सुरुवातीला असा समृद्ध डेटा उपलब्ध असेलच असे नाही. त्यामुळे फाइन-ट्यूनिंग हे उपायाच्या विकासचक्रात नंतर करता येणारे अनुकूलन आहे, असे आम्ही मानतो. उपायाचे स्वरूप स्थिर झाल्यानंतर आणि प्रत्यक्ष वापरकर्त्यांचा काही डेटा जमा झाल्यानंतर, विकासक आपले मॉडरेशन उपाय अधिक प्रगत करण्यासाठी लक्ष्यित फाइन-ट्यूनिंगचा विचार करू शकतात.

समारोप

gpt-oss-safeguard सारखी मूलभूत मॉडरेशन मॉडेल ही प्रभावी नवी आधारसाधने आहेत. प्रत्यक्ष-वेळ अनुप्रयोगांमधील विलंब कमी करतानाच मॉडरेशन प्रणालींची रचना लक्षणीयरीत्या सुलभ करण्याची क्षमता त्यांच्यात आहे. त्यांच्यासोबत लहान, गरजेनुसार तयार केलेले वर्गीकारक वापरल्यास मोठ्या सर्वसाधारण मॉडेलवर आधारित प्रॉम्प्ट पद्धतीपेक्षा कमी घटक असलेली, अधिक सुरक्षित आणि वेगवान प्रणाली तयार करता येते.

आज मॉडरेशन प्रणाली उभारत किंवा सुधारत असाल, तर प्रथम gpt-oss-safeguard सारखी मॉडेल वापरा, त्यांची कामगिरी मोजा आणि डेटामधून उणिवा दिसतील तिथे गरजेनुसार तयार केलेल्या वर्गीकारकांच्या मदतीने लक्ष्यित सुधारणा जोडा, मग ते प्रॉम्प्ट-आधारित असोत किंवा फाइन-ट्यून केलेले.

अधिक जाणून घ्यायचे आहे? आम्हाला संदेश पाठवा.

लेखक

Douglas Adams, Romain Bourboulou, David Jasek आणि Atharva Tidke