છેલ્લાં બે વર્ષમાં અમે એવા ઉકેલો બનાવ્યા છે જે લાખો વપરાશકર્તાઓ માટે સલામત રીતે વિસ્તર્યા છે. આ કાર્યનો મુખ્ય ભાગ ઝડપી અને ચોક્કસ મોડરેશન સિસ્ટમની રચના કરવાનો રહ્યો છે. અસરકારક મોડરેશન અનિચ્છનીય સર્જનો સમસ્યા બને તે પહેલાં તેમને પકડીને અંતિમ વપરાશકર્તાઓને નુકસાનથી બચાવે છે અને બ્રાન્ડની સલામતી સુનિશ્ચિત કરે છે, જેથી કંપનીઓ અત્યાધુનિક AI ઉકેલો આત્મવિશ્વાસથી લાગુ કરી શકે.
તાજેતરમાં OpenAIએ તેના GPT-OSS-Safeguard મોડલ રજૂ કર્યા: આ વર્ષની શરૂઆતમાં રજૂ થયેલા 20B અને 120B OSS મોડલનાં ફાઇન-ટ્યુન કરેલાં સંસ્કરણો. આ મોડલ અનુમાન કરતી વખતે જ વપરાશકર્તાની નીતિનું સીધું અર્થઘટન કરી શકે છે અને સામગ્રી મોડરેશન માટે લવચીક તથા શક્તિશાળી અભિગમ આપે છે. આ મોડલ સંશોધન પૂર્વાવલોકનમાં છે, તેથી સમય જતાં તેમાં નિઃસંદેહ સુધારો થતો રહેશે.
આ પ્રકાશન પહેલાં અમે OpenAI સાથે સહયોગ કરીને મોડલના વિકાસને દિશા આપવા વાસ્તવિક પરિસ્થિતિઓમાં મૂલ્યાંકન કર્યું હતું. આ લેખમાં અમે તે સહયોગમાંથી મળેલી સમજ રજૂ કરીએ છીએ અને આ પ્રગતિનો પ્રોડક્શન AI સિસ્ટમમાં મોડરેશનના ભવિષ્ય માટે શું અર્થ થાય છે તે તપાસીએ છીએ.
આજે મોડરેશન ઉકેલો સામાન્ય રીતે એપ્લિકેશનની આસપાસ ગોઠવાયેલા સુરક્ષાના સ્તરોનું સ્વરૂપ લે છે. અમે મોટી સંખ્યામાં વપરાશકર્તાઓ ધરાવતી જાહેર સેવાઓમાં આ પદ્ધતિનો વ્યાપક ઉપયોગ કરીએ છીએ. વધુ વિગતવાર માહિતી માટે આ વિષય પરનો અમારો બ્લૉગ અહીં વાંચો.
ઇનપુટનું સમાંતર વર્ગીકરણ કરો (ખરાબ પ્રોમ્પ્ટને પ્રવેશવા ન દો): દરેક વપરાશકર્તા સંદેશને લેબલ કરવા નાના, વિષય-વિશિષ્ટ વર્ગીકરણ મોડલ એકસાથે ચાલે છે. અમને જણાયું છે કે મર્યાદિત વિષય પર કેન્દ્રિત વર્ગીકરણ મોડલ એક જ સર્વસમાવેશક મોડલ કરતાં માપી શકાય એટલાં વધુ વિશ્વસનીય હોય છે. પ્રોમ્પ્ટમાં કાળજીપૂર્વક પસંદ કરેલાં ફ્યુ-શોટ ઉદાહરણો ‘આ બૉસ મને વારંવાર મારી નાખે છે’ (ગેમનો સંદર્ભ, સંપૂર્ણપણે નિર્દોષ) અને વાસ્તવિક દુનિયામાં નુકસાનના સંકેત વચ્ચેનો તફાવત ઓળખવામાં મદદ કરી શકે છે.
સલામત → સામાન્ય રીતે સામગ્રી બનાવો
જેલબ્રેક → અવગણો અથવા બ્રાન્ડને અનુરૂપ ઇનકારથી વાતને બીજી દિશામાં વાળો
સલામતી અથવા સુખાકારીનાં જોખમો → પૂરતા સંદર્ભ સાથે માનવ નિષ્ણાતને સોંપો
આઉટપુટનું વર્ગીકરણ કરો (ખરાબ જવાબ મોકલશો નહીં): પહોંચાડતા પહેલાં દરેક સંભવિત જવાબ ફરી તપાસવામાં આવે છે. આ મોડલના વર્તનમાં થતા ફેરફાર, RAG ડેટામાં ઝેરી માહિતી ઉમેરવાના હુમલા અને નુકસાનકારક સામગ્રી, PII જાહેર થવી અથવા સંવેદનશીલ માહિતી લીક થવા જેવા નીતિના સૂક્ષ્મ અપવાદરૂપ કિસ્સાઓથી રક્ષણ આપે છે. જવાબ ચિહ્નિત થાય તો પસ્તાવો થાય એવું કંઈ મોકલવાને બદલે, અમે LLM દ્વારા બનાવેલા જવાબના સ્થાને સલામત અને બ્રાન્ડને અનુરૂપ સંદેશ આપીએ છીએ અથવા તેને માનવ નિષ્ણાતને સોંપીએ છીએ.
તેને ઝડપી અને સસ્તું બનાવો: પ્રોમ્પ્ટને ફરી વાપરી શકાય તેવા આધારઘટકો તરીકે બનાવવાથી પ્રોમ્પ્ટના અંશો, વર્ગીકરણ મોડલનાં ફ્યુ-શોટ ઉદાહરણો અને સંવાદના સામાન્ય પ્રારંભિક અંશો સંગ્રહિત કરી શકાય છે. આ અભિગમ તમારા સુરક્ષા-નિયંત્રણોનો વિલંબ અને ખર્ચ બંને ઘટાડે છે.
સલામતીને ઉત્પાદનના અનુભવનો ભાગ માનોઇનકાર અને ચેતવણીઓ યોગ્ય શૈલીમાં લખાય છે, જેમ કે ગેમ માટે રમૂજી અને નાણાકીય સેવાઓ માટે ઔપચારિક. જ્યારે વપરાશકર્તા અનુભવ તેમના હેતુનો આદર કરે છે ત્યારે સુરક્ષા-નિયંત્રણોની સ્વીકૃતિ વધે છે અને જેલબ્રેકના પ્રયાસો ઘટે છે.
નિરીક્ષણ કરો, રેડ ટીમિંગ કરો અને પ્રતિસાદચક્ર પૂર્ણ કરોસતત રેડ ટીમિંગ અને જીવંત સલામતી નિયંત્રણપટ વપરાશકર્તાઓને અસર થાય તે પહેલાં નબળાઈઓ પકડવામાં મદદ કરે છે. વધારાનાં ફ્યુ-શોટ ઉદાહરણો અને/અથવા માર્ગનિર્ધારણના નિયમો આપીને અમે મોડલને કોઈપણ નવી હુમલા-પદ્ધતિ શીખવી શકીએ છીએ, જેથી એપ્લિકેશનના પ્રદર્શન સાથે સમાધાન કર્યા વિના સમય જતાં સિસ્ટમને ભેદવી વધુ મુશ્કેલ બને.
અસરકારક સુરક્ષા-નિયંત્રણો બનાવવા અને જાળવવા મુશ્કેલ છે.
વ્યવહારમાં સુસ્પષ્ટ નીતિ બનાવવા માટે મુખ્ય વ્યવસાયિક હિતધારકો અને વિકાસકર્તાઓ વચ્ચે સાવચેતીપૂર્વક સહયોગ જરૂરી છે. નીતિ નિર્ધારિત થયા પછી સિસ્ટમની રચના અને વર્તન વિકસાવીને તેને અનુકૂળ બનાવવાં પડે છે.
gpt-oss-safeguard જેવા ખુલ્લા સલામતી રিজનિંગ મોડલનું આગમન આ પ્રક્રિયાની કેટલીક મુશ્કેલીઓ દૂર કરી શકે છે અને સામગ્રી મોડરેશન માટે વધુ ઉપયોગ-તૈયાર તથા બહુમુખી પાયો આપી શકે છે.
Gpt-oss-safeguardનો હેતુ આજની મોડરેશન સિસ્ટમ બનાવતી વખતે સામાન્ય રીતે આવતા કેટલાક પડકારોનો ઉકેલ લાવવાનો છે. આ નાના, વિશિષ્ટ મોડલ અનુમાન કરતી વખતે લક્ષિત નીતિ વિશે રિજનિંગ કરવા માટે ફાઇન-ટ્યુન કરવામાં આવ્યા છે અને જેલબ્રેક, PII જાહેર થવી તથા નીતિના અન્ય ઉલ્લંઘનો જેવી નુકસાનકારક કે સંવેદનશીલ સામગ્રી શોધે છે.
વર્ગીકરણ પ્રક્રિયામાં રિજનિંગ સામેલ કરીને તેઓ વધુ ચોક્કસ અને મજબૂત મોડરેશન આપે છે, જેને ભેદવું વધુ મુશ્કેલ છે. GPT-OSS 20B અને 120Bનાં વિશિષ્ટ સલામતી સંસ્કરણો તરીકે તેઓ જરૂરિયાત મુજબની નીતિ-વ્યાખ્યાઓ દ્વારા અત્યંત ઓછી ગોઠવણી સાથે અત્યાધુનિક સલામતી પ્રદર્શન શક્ય બનાવે છે.
અમે પ્રોડક્શન જેવી અનેક કામગીરીમાં gpt-oss-safeguard 20B અને 120Bનું મૂલ્યાંકન કર્યું: તાત્કાલિક પ્રતિભાવ આપતો અવાજ સહાયક, ગેમમાં ખેલાડીઓને સહાય કરતો બૉટ, સક્રિય ચેટ મોડરેશન સિસ્ટમ અને બહુભાષી ઝેરી સામગ્રીની તપાસ (સ્પૅનિશ, ફ્રેન્ચ, ઇટાલિયન, પોર્ટુગીઝ, રશિયન અને ટર્કિશ).
વિલંબ પ્રત્યે સંવેદનશીલ અવાજ મોડરેશન: અમારી તાત્કાલિક અવાજ કસોટીમાં, એટલે કે ગેમપ્લે ચેટ મોડરેશનની જેમ સંવાદ દરમિયાન જ જવાબનું વિશ્લેષણ અને પ્રાથમિકતા નક્કી કરવાની સ્થિતિમાં, gpt-oss-safeguard-20Bએ GPT-OSS-20B અને GPT-5-Mini વચ્ચેની ચોકસાઈની અંદાજે 80% ખાઈ પૂરી કરી (0.45થી વધીને 0.71, જ્યારે GPT-5-Mini માટે 0.78), અને તે પણ ઘણો ઓછો વિલંબ રાખીને.
ખેલાડી સહાયને આગળ સોંપવી: ખેલાડી સહાયની પ્રાથમિકતા નક્કી કરવામાં gpt-oss-safeguard-20Bએ GPT-OSS-20bથી GPT-5-Mini સુધીની અંદાજે 90% ખાઈ પૂરી કરી (0.57થી વધીને 0.66, જ્યારે GPT-5-Mini માટે 0.67). તેણે સમૂહમાં શ્રેષ્ઠ સર્વવર્ગીય ચોકસાઈ, નિર્દોષ સામગ્રી પર 88% પુનઃપ્રાપ્તિ અને સંવેદનશીલ વપરાશકર્તાઓની ઓળખમાં 87% ચોકસાઈ પણ આપી. માનવ સમીક્ષકો પર વધુ ભાર નાખ્યા વિના સાવધ અને અત્યંત વિશ્વસનીય રીતે કેસ આગળ સોંપવા હોય તો આ ઉપયોગી છે.
મોટા પાયે નીતિ-સઘન ચેટ મોડરેશન: અમારા સૌથી પડકારજનક મૂલ્યાંકનમાં મોડરેશન સિસ્ટમે વિગતવાર નીતિદસ્તાવેજ મુજબ ગેમના સંદેશોને સક્રિય રીતે ચિહ્નિત કરવાના હતા. તેમાં gpt-oss-safeguardએ OSSના મૂળ માપદંડ કરતાં સ્પષ્ટપણે સારું પ્રદર્શન કર્યું, અંદાજે 35% સાપેક્ષ વધારો મેળવ્યો અને લાંબી નીતિઓને અસરકારક રીતે સંભાળી. આ અત્યંત સંવેદનશીલ ઉપયોગ છે, જેમાં ઊંચી પુનઃપ્રાપ્તિ અને ચોકસાઈ જરૂરી છે. પુનઃપ્રાપ્તિ ઘણી ઓછી હોય તો અનેક નુકસાનકારક સંદેશ ચૂકી જશે. ચોકસાઈ ઓછી હોય તો ઘણા અસંબંધિત સંદેશ માનવ મધ્યસ્થીઓ માટે ચિહ્નિત થશે અને તેમનું ધ્યાન ખરેખર મુશ્કેલ કિસ્સાઓથી ભટકશે.
બહુભાષી પ્રદર્શન: છ ભાષાના સંતુલિત ઝેરી સામગ્રી ડેટાસેટ પર gpt-oss-safeguardનું પ્રદર્શન GPT-5-Miniની નજીક રહ્યું અને ચોકસાઈમાં સામાન્ય રીતે 3થી 5 ટકા પોઇન્ટનો તફાવત હતો. સ્પૅનિશમાં gpt-oss-safeguard-120B થોડું આગળ રહ્યું. ટર્કિશ જેવી ઓછાં સંસાધનો ધરાવતી ભાષાઓમાં અમને થોડો મોટો તફાવત જોવા મળ્યો, પરંતુ એકંદર પરિણામ વિવિધ ભાષાઓમાં મજબૂત પ્રદર્શનનું હતું અને 20Bથી 120B પર જતાં પુનઃપ્રાપ્તિમાં સતત વધારો થયો.
અમે એ પણ જોયું કે મોડરેશનમાં જ્યાં LLM પરંપરાગત રીતે નબળાં પડે છે ત્યાં gpt-oss-safeguard મોડલ મજબૂત પ્રદર્શન કરે છે. ઉદાહરણ તરીકે, મુખ્યધારાનાં મોડલ PII ડેટામાં અમેરિકી શૈલીના PIIને ઓળખવા તરફ વધુ ઝુકાવ ધરાવે છે અને અન્ય ભૌગોલિક વિસ્તારોમાં તેમનું પ્રદર્શન નબળું રહે છે. તેથી અમારું માનવું છે કે વ્યાપક LLM સંભાળી ન શકે એવા નીતિના નાના ઉલ્લંઘનો શોધવા માટે જરૂરિયાત મુજબનાં સાધનો પરની નિર્ભરતા ઘટાડીને gpt-oss-safeguard મોડરેશનની ગોઠવણી સરળ બનાવવામાં ઉપયોગી થશે.
આમ, અમારા મૂલ્યાંકનોએ સ્થાપિત કર્યું છે કે gpt-oss-safeguard-20B અને gpt-oss-safeguard-120B જેવા ‘પાયાના મોડરેશન મોડલ’ તમને ઝડપથી ઘણું આગળ લઈ જશે. જોકે, સિસ્ટમમાં સલામતી અને વિશિષ્ટતાના સર્વોચ્ચ ધોરણોની જરૂર હોય ત્યારે ક્ષેત્ર-વિશિષ્ટ ફાઇન-ટ્યુન કરેલા મોડલ હજુ પણ શ્રેષ્ઠ માપદંડ છે.


ગેમમાં મોડરેશનના ઉપયોગ માટે અમે મધ્યસ્થીઓની અંદાજે 10 હજાર ઐતિહાસિક कार्रવાઈઓ અને નીતિના પરિણામો પર સુપરવાઇઝ્ડ ફાઇન-ટ્યુનિંગનો ઉપયોગ કરીને Qwen3-0.6B વર્ગીકરણ મોડલને ફાઇન-ટ્યુન કર્યું. આ કાર્યમાં આ મોડલનું પ્રદર્શન અમે ચકાસેલા દરેક મૂળ મોડલ કરતાં નોંધપાત્ર રીતે સારું રહ્યું. તેણે 15%ની સરખામણીમાં 57% ચોકસાઈ મેળવી (gpt-oss-safeguard-120B માટે, GPT-4.1-nanoના પ્રદર્શનના ગુણોત્તર પરથી અંદાજિત), એટલે કે +42 પોઇન્ટ અથવા અંદાજે 280%નો વધારો. આ પરિણામો OpenAIના એ માર્ગદર્શનને અનુરૂપ છે કે લેબલ કરેલા ઉદાહરણો પર તાલીમ પામેલા નાના, સમર્પિત વર્ગીકરણ મોડલ વિશિષ્ટ ક્ષેત્રોમાં સુરક્ષા મોડલ કરતાં વધુ સારું પ્રદર્શન કરી શકે છે.
નિષ્કર્ષ સ્પષ્ટ છે: નીતિઓ સૂક્ષ્મ હોય અને તેમાં ઘણા અપવાદરૂપ કિસ્સા હોય ત્યારે નાનું, ક્ષેત્રને અનુરૂપ બનાવેલું મોડલ હજુ પણ શ્રેષ્ઠ ધોરણ છે. ફાઇન-ટ્યુનિંગની પ્રક્રિયા તમારી નીતિ અને અપવાદરૂપ કિસ્સાઓને સીધા પરિમાણોમાં સમાવી દે છે, જેથી પ્રોડક્શનની અવ્યવસ્થિત વાસ્તવિક પરિસ્થિતિઓમાં વર્તન વધુ સ્થિર રહે છે અને વિલંબ તથા ખર્ચ પણ અત્યંત ઓછાં રહે છે.
સુપરવાઇઝ્ડ ફાઇન-ટ્યુનિંગ આ માટેના અનેક સંભવિત અભિગમોમાંથી માત્ર એક છે. મોડલના વર્તનને વધુ અનુકૂળ બનાવવા માટે રીઇન્ફોર્સમેન્ટ લર્નિંગ અથવા નીતિ-આધારિત નિસ્યંદન જેવી અન્ય શક્તિશાળી તાલીમ તકનીકોનો પણ લાભ લઈ શકાય છે.
ફાઇન-ટ્યુનિંગ માટે સામાન્ય રીતે મોટા પ્રમાણમાં ડેટાની જરૂર પડે છે. આ Qwen3-0.6B વર્ગીકરણ મોડલને ફાઇન-ટ્યુન કરવા માટે ઉપયોગમાં લેવાયેલા ડેટાસેટને માનવ મધ્યસ્થીઓએ જાતે લેબલ કર્યો હતો, તેથી તે સ્વચ્છ અને અત્યંત વિશ્વસનીય સત્યસ્રોત હતો.
ઘણા પ્રોજેક્ટમાં શરૂઆતથી જ આટલો સમૃદ્ધ ડેટાનો લાભ ઉપલબ્ધ ન પણ હોય. તેથી અમે ફાઇન-ટ્યુનિંગને સામાન્ય રીતે એવું અનુકૂલન માનીએ છીએ જે ઉકેલના વિકાસચક્રમાં પછીથી કરી શકાય. ઉકેલનું સ્વરૂપ સ્થિર થઈ જાય અને વપરાશકર્તાઓનો થોડો વાસ્તવિક ડેટા એકત્ર થાય પછી વિકાસકર્તાઓ તેમના મોડરેશન ઉકેલોને આગલા સ્તરે લઈ જવા માટે લક્ષિત ફાઇન-ટ્યુનિંગ અપનાવી શકે છે.
gpt-oss-safeguard જેવા પાયાના મોડરેશન મોડલ નવા અને મજબૂત આધારઘટકો છે. તેઓ તાત્કાલિક પ્રતિભાવ આપતી એપ્લિકેશનોમાં વિલંબ ઘટાડવાની સાથે મોડરેશન સિસ્ટમની રચનાને નોંધપાત્ર રીતે સરળ બનાવી શકે છે. તેમને નાના, જરૂરિયાત મુજબ બનાવેલા વર્ગીકરણ મોડલ સાથે જોડીને તમે મોટા સામાન્ય મોડલના પ્રોમ્પ્ટ-આધારિત અભિગમ કરતાં ઓછા ચલિત ભાગો ધરાવતી વધુ સલામત અને ઝડપી સિસ્ટમ બનાવી શકો છો.
જો તમે આજે મોડરેશન શરૂ કરી રહ્યા હો અથવા તેને સુધારી રહ્યા હો, તો પહેલાં gpt-oss-safeguard જેવા મોડલથી શરૂઆત કરો, પ્રદર્શન માપો અને ડેટા જ્યાં ખામીઓ દર્શાવે ત્યાં જરૂરિયાત મુજબ બનાવેલા વર્ગીકરણ મોડલ દ્વારા લક્ષિત સુધારા ઉમેરો, પછી ભલે તે પ્રોમ્પ્ટ-આધારિત હોય કે ફાઇન-ટ્યુન કરેલા.
વધુ જાણવામાં રસ છે? અમને સંદેશ મોકલો.