ባለፉት ሁለት ዓመታት ለሚሊዮኖች ተጠቃሚዎች በደህንነት ሊስፋፉ የቻሉ መፍትሔዎችን ገንብተናል። ፈጣንና ትክክለኛ የይዘት ቁጥጥር ሥርዓቶችን መንደፍ የዚህ ሥራ ዋና ክፍል ነበር። ውጤታማ የይዘት ቁጥጥር ኩባንያዎች ዘመናዊ የAI መፍትሔዎችን በመተማመን እንዲያሰማሩ፣ ተጠቃሚዎችን ከጉዳት እንዲጠብቁና ያልተፈለጉ ውጤቶችን ችግር ከመሆናቸው በፊት በመለየት የምርት ስማቸውን እንዲያስጠብቁ ያስችላል።
በቅርቡ፣ OpenAI የGPT-OSS-Safeguard ሞዴሎቹን ለቋል፤ እነዚህም በዚህ ዓመት መጀመሪያ የተዋወቁት የ20B እና 120B OSS ሞዴሎች በጥሩ ማስተካከያ የተዘጋጁ ስሪቶች ናቸው። እነዚህ ሞዴሎች የተጠቃሚውን ፖሊሲ በአፈጻጸም ጊዜ በቀጥታ መተርጎም ይችላሉ፤ ይህም ለይዘት ቁጥጥር ተለዋዋጭና ኃይለኛ ዘዴ ይሰጣል። እነዚህ ሞዴሎች በምርምር ቅድመ ዕይታ ደረጃ ላይ ስለሆኑ፣ ከጊዜ ወደ ጊዜ መሻሻላቸው አይቀርም።
ይፋ ከመደረጉ በፊት ከOpenAI ጋር በመተባበር፣ የሞዴሉን ልማት ለማገዝ በእውነተኛ አጠቃቀም ላይ የተመሠረቱ ግምገማዎችን አካሂደናል። በዚህ ጽሑፍ ከዚያ ትብብር ያገኘናቸውን ግንዛቤዎች እናጋራለን፤ እነዚህ እድገቶችም በምርት AI ሥርዓቶች ውስጥ ለይዘት ቁጥጥር የወደፊት ሁኔታ ምን ማለት እንደሆኑ እንመረምራለን።
ዛሬ የይዘት ቁጥጥር መፍትሔዎች በተለምዶ በመተግበሪያው ዙሪያ እንደተዘረጉ የጥበቃ ንብርብሮች ይገነባሉ። ይህን ንድፍ ከፍተኛ አጠቃቀም ባላቸውና ለሕዝብ በቀረቡ ማሰማራቶች ላይ በስፋት እንጠቀማለን። ለበለጠ ዝርዝር፣ ስለዚህ ጉዳይ የጻፍነውን ጦማር እዚህ ይመልከቱ።
ግብዓቶችን በትይዩ ይመድቡ፣ መጥፎ እርምጃዎችን አያስገቡ፦ አነስተኛና በተወሰኑ ርዕሶች ላይ የሚያተኩሩ መደብ ለዪዎች እያንዳንዱን የተጠቃሚ መልዕክት ለመሰየም በአንድ ጊዜ ይሠራሉ። በጠባብ ወሰን ላይ የሚያተኩሩ መደብ ለዪዎች ሁሉን ከሚሸፍን አንድ መደብ ለዪ በሚለካ ደረጃ ይበልጥ አስተማማኝ ሆነው አግኝተናቸዋል። በእርምጃው ውስጥ በጥንቃቄ የተመረጡ እጥር ምጥን ምሳሌዎች፣ “I keep getting killed by this boss” (የጨዋታ ዐውድ፣ ፈጽሞ ጉዳት የሌለው) ከሚለው እና እውነተኛ የጉዳት ምልክት መካከል ያለውን ልዩነት ለመለየት ይረዳሉ።
ደህንነቱ የተጠበቀ → በመደበኛነት ያመንጩ
ጄልብሬኮች → ችላ ይበሉ ወይም ከምርት ስሙ ድምፅ ጋር በሚጣጣም እምቢታ ያስቀሩ
የደህንነት ወይም የደኅንነት ስጋቶች → ከበቂ ዐውድ ጋር ወደ ሰው ያስተላልፉ
ውጤቶችን ይመድቡ፣ መጥፎ መልስ አይላኩ፦ እያንዳንዱ ሊላክ የሚችል ምላሽ ከመድረሱ በፊት እንደገና ይጣራል። ይህ ከሞዴል መዛባት፣ ከRAG ውሂብ መበከልና እንደ ጎጂ ይዘት፣ የPII መጋለጥ ወይም የሚስጥራዊ መረጃ ፍሰት ካሉ ስውር የፖሊሲ ልዩ ሁኔታዎች ይጠብቃል። ከተሰየመ፣ በኋላ የሚያስቆጨንን ነገር ከመላክ ይልቅ በLLM የመነጨውን መልስ ደህንነቱ በተጠበቀና ከምርት ስሙ ጋር በሚጣጣም መልዕክት እንተካለን ወይም ወደ ሰው እናስተላልፈዋለን።
ፈጣንና ተመጣጣኝ ያድርጉት፦ እርምጃዎችን እንደገና ጥቅም ላይ የሚውሉ መሠረቶች አድርጎ መገንባት፣ የእርምጃ ክፍሎችን፣ የመደብ ለዪ እጥር ምጥን ምሳሌዎችንና የተለመዱ የውይይት መግቢያዎችን በመሸጎጫ እንዲያከማቹ ያስችላል። ይህ ዘዴ የጥበቃ ሥርዓቶችዎን መዘግየትና ወጪ ይቀንሳል።
ደህንነትን እንደ የምርት ተሞክሮ ይዩት እምቢታዎችና ማስጠንቀቂያዎች ከምርቱ ድምፅ ጋር እንዲጣጣሙ ይጻፋሉ፤ ለምሳሌ ለጨዋታዎች ቀልደኛ፣ ለፋይናንስ መደበኛ ይሆናሉ። የተጠቃሚ ተሞክሮው የተጠቃሚውን ዓላማ ሲያከብር፣ የጥበቃ ሥርዓቶች ተቀባይነት ይጨምራል፤ የጄልብሬክ ሙከራዎችም ይቀንሳሉ።
ይከታተሉ፣ በእሳት ይፈትኑ፣ ዑደቱንም ይዝጉ ቀጣይነት ያለው በእሳት መፈተንና ቀጥታ የደህንነት ዳሽቦርዶች፣ ችግሮች ተጠቃሚዎች ጋር ከመድረሳቸው በፊት ለመለየት ይረዳሉ። ተጨማሪ እጥር ምጥን ምሳሌዎችን እና/ወይም የማስተላለፊያ ደንቦችን በማቅረብ ማናቸውንም አዲስ የጥቃት ንድፍ ለሞዴሉ ማስተማር እንችላለን፤ በዚህም የመተግበሪያውን አፈጻጸም ሳናዳክም ሥርዓቱ ከጊዜ ወደ ጊዜ ለመስበር ይበልጥ አስቸጋሪ ይሆናል።
ውጤታማ የጥበቃ ሥርዓቶችን መገንባትና መንከባከብ ከባድ ነው።
በተግባር በግልጽ የተቀመጠ ፖሊሲ ለመፍጠር፣ በዋና የንግድ ባለድርሻዎችና በገንቢዎች መካከል ጥንቃቄ የተሞላበት ትብብር ያስፈልጋል። ከዚያም ፖሊሲው ከተገለጸ በኋላ፣ የሥርዓቱ ንድፍና ባህሪ መገንባትና መስተካከል አለበት።
እንደ gpt-oss-safeguard ያሉ ክፍት የደህንነት ማመዛዘን ሞዴሎች መምጣት፣ በዚህ ሂደት ያሉ አንዳንድ ችግሮችን ሊፈታና ለይዘት ቁጥጥር ለመጠቀም ዝግጁ የሆነና ሁለገብ መሠረት ሊሰጥ ይችላል።
Gpt-oss-safeguard የዛሬ የይዘት ቁጥጥር ሥርዓቶችን ሲገነቡ የሚያጋጥሙ አንዳንድ የተለመዱ ተግዳሮቶችን ለመፍታት ያለመ ነው። እነዚህ አነስተኛና ልዩ ሞዴሎች፣ በአፈጻጸም ጊዜ በታለመው ፖሊሲ ላይ እንዲያመዛዝኑና እንደ ጄልብሬኮች፣ የPII መጋለጥና ሌሎች የፖሊሲ ጥሰቶች ያሉ ጎጂ ወይም ሚስጥራዊ ይዘቶችን እንዲፈልጉ በጥሩ ማስተካከያ ተዘጋጅተዋል።
ማመዛዘንን በምደባ ሂደታቸው ውስጥ በማካተት፣ ለማለፍ አስቸጋሪ የሆነ ይበልጥ ትክክለኛና ጠንካራ የይዘት ቁጥጥር ያቀርባሉ። የGPT-OSS 20B እና 120B ልዩ የደህንነት ስሪቶች በመሆናቸው፣ በብጁ የፖሊሲ ትርጉሞች አማካይነት አነስተኛ የማዋቀር ሥራ ብቻ እየጠየቁ እጅግ ዘመናዊ የደህንነት አፈጻጸም ይሰጣሉ።
gpt-oss-safeguard 20B እና 120Bን በበርካታ የምርት አጠቃቀምን በሚመስሉ ተግባራት ገምግመናል፦ ቅጽበታዊ የድምፅ ረዳት፣ የጨዋታ ውስጥ የተጫዋች ድጋፍ ቦት፣ አስቀድሞ እርምጃ የሚወስድ የውይይት ቁጥጥር ሥርዓት እና በብዙ ቋንቋዎች የመርዛማ ይዘት ፍተሻ—ስፓኒሽ፣ ፈረንሳይኛ፣ ጣልያንኛ፣ ፖርቱጋልኛ፣ ሩሲያኛ እና ቱርክኛ።
ለመዘግየት ስሱ የድምፅ ቁጥጥር፦ በቅጽበታዊ የድምፅ ፈተናዎቻችን—ለምሳሌ እንደ የጨዋታ ውይይት ቁጥጥር፣ ምላሽ በውይይት መካከል ተንትኖ የቅድሚያ ውሳኔ በሚሰጥበት ቀጥታ ምደባ—gpt-oss-safeguard-20B በGPT-OSS-20B እና GPT-5-Mini መካከል የነበረውን የትክክለኛነት ክፍተት ወደ 80% ዘግቷል (ከ0.45 ወደ 0.71፣ ከ0.78 ጋር ሲነጻጸር)፤ ይህንንም በእጅጉ ዝቅተኛ መዘግየት አሳክቷል።
የተጫዋች ድጋፍ ማስተላለፍ፦ በተጫዋች ድጋፍ ቅድሚያ ምደባ፣ gpt-oss-safeguard-20B ከGPT-OSS-20b እስከ GPT-5-Mini ያለውን ክፍተት ወደ 90% ዘግቷል (ከ0.57 ወደ 0.66፣ ከ0.67 ጋር ሲነጻጸር)። በተጨማሪም በስብስቡ ውስጥ ምርጡን የማክሮ ትክክለኛነት፣ ጉዳት በሌለው ይዘት ላይ 88% የመለየት ምጣኔ እና ተጋላጭ ተጠቃሚዎችን በመለየት 87% ትክክለኛነት አስመዝግቧል፤ ይህም የሰው ገምጋሚዎችን በብዙ ጉዳዮች ሳያጥለቀልቁ ጥንቃቄ የተሞላበትና ከፍተኛ እምነት ያለው ማስተላለፍ ለሚፈልጉ ጠቃሚ ነው።
በብዙ ፖሊሲዎች የተጨናነቀ የውይይት ቁጥጥር በስፋት፦ የይዘት ቁጥጥር ሥርዓቱ ዝርዝር የፖሊሲ ሰነድን ተከትሎ የጨዋታ ውስጥ መልዕክቶችን አስቀድሞ እንዲሰይም በሚጠይቀው ከባዱ ግምገማችን፣ gpt-oss-safeguard ከOSS መሠረታዊ ሞዴል በግልጽ ልዩነት በልጦ ወደ 35% አንጻራዊ ጭማሪ አስመዝግቧል፤ ረጅም ፖሊሲዎችንም በውጤታማነት አስተናግዷል። ይህ ከፍተኛ የመለየት ምጣኔና ትክክለኛነት የሚጠይቅ በተለይ ስሱ የአጠቃቀም ሁኔታ ነው። የመለየት ምጣኔው በጣም ዝቅተኛ ከሆነ፣ ብዙ ጎጂ መልዕክቶች ሳይለዩ ያልፋሉ። ዝቅተኛ የትክክለኛነት ውጤት ደግሞ ብዙ የማይመለከቱ መልዕክቶች ለሰው ተቆጣጣሪዎች እንዲሰየሙ ያደርጋል፤ ትኩረታቸውንም በእውነት አስቸጋሪ ከሆኑ ጉዳዮች ያርቃል።
የብዙ ቋንቋዎች አፈጻጸም፦ በስድስት ቋንቋዎች በተመጣጠነ የመርዛማ ይዘት የውሂብ ስብስብ ላይ፣ gpt-oss-safeguard ከGPT-5-Mini ጋር ተቀራራቢ ውጤት አሳይቷል፤ በትክክለኛነት በተለምዶ ከ3–5 በመቶኛ ነጥብ ውስጥ ሲሆን፣ gpt-oss-safeguard-120B በስፓኒሽ በትንሹ በልጧል። እንደ ቱርክኛ ባሉ አነስተኛ ሀብት ባላቸው ቋንቋዎች በመጠኑ ሰፋ ያሉ ክፍተቶችን ብናይም፣ አጠቃላይ ሁኔታው ጠንካራ የቋንቋ ተሻጋሪ አፈጻጸም ነበር፤ ከ20B ወደ 120B ሲሸጋገርም የመለየት ምጣኔው በተከታታይ ጨምሯል።
የgpt-oss-safeguard ሞዴሎች፣ LLMዎች በይዘት ቁጥጥር ላይ በተለምዶ ደካማ በሚሆኑባቸው እንደ PII ውሂብ ያሉ ዘርፎችም ጠንካራ አፈጻጸም እንዳላቸው አይተናል። ዋና ሞዴሎች የአሜሪካን አይነት PII ውሂብ ወደ መለየት ያደላሉ፤ በሌሎች ክልሎች ግን ደካማ አፈጻጸም ያሳያሉ። በዚህም፣ gpt-oss-safeguard ሰፊ አጠቃቀም ያላቸው LLMዎች ሊያስተናግዷቸው የማይችሉ አነስተኛ የፖሊሲ ጥሰቶችን ለመለየት በብጁ መሣሪያዎች ላይ ያለውን ጥገኝነት በመቀነስ፣ የይዘት ቁጥጥር ውቅሮችን ለማቅለል ጠቃሚ ይሆናል ብለን እናምናለን።
ስለዚህ ግምገማዎቻችን፣ እንደ gpt-oss-safeguard-20B እና gpt-oss-safeguard-120B ያሉ «መሠረታዊ የይዘት ቁጥጥር ሞዴሎች» በፍጥነት ብዙ ርቀት እንዲጓዙ እንደሚያስችሉ አረጋግጠዋል። ሆኖም ሥርዓቶች ከፍተኛውን የደህንነትና የትክክለኛነት ደረጃ ሲጠይቁ፣ ለአንድ ዘርፍ በተለይ የተስተካከሉ ሞዴሎች አሁንም ምርጡ መለኪያ ናቸው።


ለጨዋታ ውስጥ ይዘት ቁጥጥር፣ ወደ 10 ሺህ በሚጠጉ ታሪካዊ የተቆጣጣሪዎች እርምጃዎችና የፖሊሲ ውጤቶች ላይ ክትትል የሚደረግበት ጥሩ ማስተካከያ በመጠቀም Qwen3-0.6B መደብ ለዪን አስተካክለናል። ይህ ሞዴል በዚህ ተግባር ከፈተንናቸው መሠረታዊ ሞዴሎች ሁሉ በከፍተኛ ልዩነት ይበልጣል፤ ከ15% ጋር ሲነጻጸር 57% ትክክለኛነትን (የgpt-oss-safeguard-120B ውጤት ከGPT-4.1-nano አፈጻጸም ምጥጥን የተገመተ) አስመዝግቧል፤ ይህም የ42 በመቶኛ ነጥብ ወይም ወደ 280% ጭማሪ ነው። እነዚህ ውጤቶች፣ በተሰየሙ ምሳሌዎች ላይ የሰለጠኑ አነስተኛና ልዩ መደብ ለዪዎች በተወሰኑ ዘርፎች ከጥበቃ ሞዴሎች ሊበልጡ እንደሚችሉ ከሚገልጸው የOpenAI መመሪያ ጋር ይስማማሉ።
ዋናው መልዕክት ግልጽ ነው፦ ፖሊሲዎች ውስብስብና ብዙ ልዩ ሁኔታዎች ያሏቸው ሲሆኑ፣ ለዘርፉ የተስተካከለ አነስተኛ ሞዴል አሁንም ምርጡ መለኪያ ነው። የጥሩ ማስተካከያ ሂደቱ ፖሊሲዎንና ልዩ ሁኔታዎቹን በቀጥታ በመለኪያዎቹ ውስጥ ያካትታል፤ በእውነተኛ የምርት አካባቢ ውስብስብነት ውስጥ የተረጋጋ ባህሪን በእጅግ አነስተኛ መዘግየትና ወጪ ያቀርባል።
ክትትል የሚደረግበት ጥሩ ማስተካከያ ለዚህ ከሚቻሉት በርካታ ዘዴዎች አንዱ ብቻ ነው። የሞዴሉን ባህሪ የበለጠ ለማመቻቸት እንደ የማጠናከሪያ ትምህርት ወይም በፖሊሲ ላይ የተመሠረተ እውቀት ማጥለል ያሉ ሌሎች ኃይለኛ የሥልጠና ዘዴዎችንም መጠቀም ይቻላል።
ጥሩ ማስተካከያ በተለምዶ ብዙ ውሂብ ይፈልጋል። ይህን Qwen3-0.6B መደብ ለዪ ለማስተካከል የዋለው የውሂብ ስብስብ በሰው ተቆጣጣሪዎች በእጅ የተሰየመ ስለነበር፣ ንጹሕና እጅግ አስተማማኝ የእውነት ምንጭ ነበር።
በብዙ ፕሮጀክቶች ይህ የበለጸገ የውሂብ ጥቅም ከመጀመሪያው ላይኖር ይችላል። ስለዚህ ጥሩ ማስተካከያን በመፍትሔው የልማት ዑደት በኋላ ሊካተት የሚችል ማመቻቸት አድርገን እንመለከተዋለን። የመፍትሔው ቅርጽ ከተረጋጋና ከእውነተኛ ተጠቃሚዎች የተወሰነ ውሂብ ከተሰበሰበ በኋላ፣ ገንቢዎች የይዘት ቁጥጥር መፍትሔዎቻቸውን ወደ ቀጣዩ ደረጃ ለማድረስ የታለመ ጥሩ ማስተካከያን መጠቀም ሊጀምሩ ይችላሉ።
እንደ gpt-oss-safeguard ያሉ መሠረታዊ የይዘት ቁጥጥር ሞዴሎች ጠንካራ አዳዲስ መሠረቶች ናቸው። የይዘት ቁጥጥር ሥርዓቶችን ንድፍ በእጅጉ ሊያቀሉና በቅጽበት ለሚሠሩ መተግበሪያዎች መዘግየትን ሊቀንሱ ይችላሉ። ከአነስተኛ ብጁ መደብ ለዪዎች ጋር በማጣመር፣ ትላልቅ አጠቃላይ ሞዴሎችን ከሚጠቀም በእርምጃ ላይ የተመሠረተ ዘዴ ይልቅ አነስተኛ ክፍሎች ያሉት፣ ይበልጥ ደህንነቱ የተጠበቀና ፈጣን ሥርዓት መገንባት ይችላሉ።
ዛሬ የይዘት ቁጥጥር ሥርዓት እያቋቋሙ ወይም እያሻሻሉ ከሆነ፣ መጀመሪያ እንደ gpt-oss-safeguard ባሉ ሞዴሎች መጀመር፣ አፈጻጸማቸውን መለካትና ውሂቡ ክፍተት በሚያሳይበት ቦታ ብጁ መደብ ለዪዎችን—በእርምጃ ላይ የተመሠረቱ ወይም በጥሩ ማስተካከያ የተዘጋጁ—መጨመር ያስቡበት።
ተጨማሪ ማወቅ ይፈልጋሉ? መልዕክት ይላኩልን።