கடந்த இரண்டு ஆண்டுகளில், பல மில்லியன் பயனர்களுக்குப் பாதுகாப்பாக விரிவாக்கப்பட்ட தீர்வுகளை நாங்கள் உருவாக்கியுள்ளோம். வேகமான, துல்லியமான உள்ளடக்கக் கட்டுப்பாட்டு அமைப்புகளை வடிவமைப்பது இப்பணியின் முக்கிய அங்கமாக இருந்துள்ளது. தேவையற்ற உருவாக்கங்கள் சிக்கலாக மாறுவதற்கு முன்பே அவற்றைக் கண்டறிந்து, இறுதிப் பயனர்களைத் தீங்கிலிருந்து காத்து, நிறுவனப் பெயரின் பாதுகாப்பையும் உறுதிசெய்வதன் மூலம், நிறுவனங்கள் அதிநவீன AI தீர்வுகளை நம்பிக்கையுடன் அறிமுகப்படுத்தச் சிறந்த உள்ளடக்கக் கட்டுப்பாடு உதவுகிறது.
அண்மையில், OpenAI தனது GPT-OSS-Safeguard மாடல்களை வெளியிட்டது. இவை இந்த ஆண்டின் தொடக்கத்தில் அறிமுகப்படுத்தப்பட்ட 20B மற்றும் 120B OSS மாடல்களின் நுண்சீரமைக்கப்பட்ட பதிப்புகள். அனுமானச் செயல்பாட்டின்போதே பயனரின் கொள்கையை இந்த மாடல்கள் நேரடியாகப் புரிந்துகொள்வதால், உள்ளடக்கக் கட்டுப்பாட்டுக்கு நெகிழ்வான, ஆற்றல்மிக்க அணுகுமுறை கிடைக்கிறது. இந்த மாடல்கள் ஆராய்ச்சி முன்னோட்ட நிலையில் இருப்பதால், காலப்போக்கில் தொடர்ந்து மேம்படும் என்பதில் ஐயமில்லை.
இந்த வெளியீட்டுக்கு முன்பாக OpenAI உடன் இணைந்து, மாடல் உருவாக்கத்திற்கு வழிகாட்ட நிஜ உலக மதிப்பீடுகளை மேற்கொண்டோம். அந்தக் கூட்டுப்பணியில் பெற்ற நுண்ணறிவுகளை இந்தக் கட்டுரையில் பகிர்வதுடன், நடைமுறை AI அமைப்புகளின் எதிர்கால உள்ளடக்கக் கட்டுப்பாட்டுக்கு இந்த முன்னேற்றங்கள் எதைக் குறிக்கின்றன என்பதையும் ஆராய்கிறோம்.
இன்றைய உள்ளடக்கக் கட்டுப்பாட்டுத் தீர்வுகள் பொதுவாகப் பயன்பாட்டைச் சுற்றி அமைக்கப்பட்ட பல அடுக்குப் பாதுகாப்பாக வடிவம் பெறுகின்றன. அதிக அளவிலான, பொதுமக்கள் பயன்படுத்தும் நிறுவல்களில் இந்த முறையை நாங்கள் அடிக்கடி பயன்படுத்துகிறோம். இதை விரிவாக அறிய, எங்கள் வலைப்பதிவை இங்கே படிக்கலாம்.
உள்ளீடுகளை இணையாக வகைப்படுத்துங்கள்; தீய ப்ராம்ப்ட்களை உள்ளே விடாதீர்கள்: சிறிய, தலைப்புக்கே உரிய வகைப்படுத்திகள் ஒரே நேரத்தில் இயங்கி ஒவ்வொரு பயனர் செய்திக்கும் வகைக்குறி இடுகின்றன. அனைத்தையும் கையாளும் ஒரே வகைப்படுத்தியைவிடக் குறுகிய நோக்கம் கொண்ட வகைப்படுத்திகள் அளவிடத்தக்க வகையில் நம்பகமானவை என்பதை நாங்கள் கண்டறிந்துள்ளோம். ப்ராம்ப்ட்டில் கவனமாகத் தேர்ந்தெடுக்கப்பட்ட ஃப்யூ-ஷாட் எடுத்துக்காட்டுகள், “இந்தத் தலைவனால் நான் மீண்டும் மீண்டும் கொல்லப்படுகிறேன்” என்பதற்கும் (விளையாட்டுச் சூழல்; முற்றிலும் தீங்கற்றது) நிஜ உலகத் தீங்கிற்கான அறிகுறிக்கும் இடையிலான வேறுபாட்டை அறிய உதவும்.
பாதுகாப்பானது → வழக்கம்போல் உருவாக்குங்கள்.
ஜெயில்பிரேக்குகள் → புறக்கணியுங்கள் அல்லது நிறுவனப் பாணிக்கு ஏற்ற மறுப்புடன் திசைதிருப்புங்கள்.
பாதுகாப்பு அல்லது நல்வாழ்வு அபாயங்கள் → விரிவான சூழல் தகவலுடன் மனிதரிடம் மேலாய்வுக்கு அனுப்புங்கள்.
வெளியீடுகளை வகைப்படுத்துங்கள்; மோசமான பதிலை அனுப்பாதீர்கள்: வழங்குவதற்கு முன்பு ஒவ்வொரு பதில் வாய்ப்பும் மீண்டும் சோதிக்கப்படுகிறது. மாடல் தடம்புரளுதல், RAG தரவு நச்சூட்டல் மற்றும் தீங்கு விளைவிக்கும் உள்ளடக்கம், PII வெளிப்பாடு அல்லது முக்கியத் தகவல் கசிவு போன்ற நுட்பமான கொள்கை விளிம்பு நிலைகளிலிருந்து இது பாதுகாக்கிறது. சிக்கல் குறிக்கப்பட்டால், பின்னர் வருந்தக்கூடிய பதிலை அனுப்புவதற்குப் பதிலாக, LLM உருவாக்கிய பதிலைப் பாதுகாப்பான, நிறுவனப் பாணிக்கு ஏற்ற செய்தியால் மாற்றுகிறோம் அல்லது மனிதரின் மேலாய்வுக்கு அனுப்புகிறோம்.
வேகமாகவும் செலவு குறைவாகவும் ஆக்குங்கள்: ப்ராம்ப்ட்களை மீண்டும் பயன்படுத்தக்கூடிய கட்டுமானக் கூறுகளாக உருவாக்குவதன் மூலம், ப்ராம்ப்ட் துணுக்குகள், வகைப்படுத்திகளின் ஃப்யூ-ஷாட் எடுத்துக்காட்டுகள் மற்றும் பொதுவான உரையாடல் முன்னொட்டுகளை இடைமாற்றகத்தில் சேமிக்கலாம். இந்த அணுகுமுறை உங்கள் பாதுகாப்புக் கட்டுப்பாடுகளின் தாமதத்தையும் செலவையும் குறைக்கிறது.
பாதுகாப்பைத் தயாரிப்பின் பயனர் அம்சமாகக் கருதுங்கள். மறுப்புகளும் எச்சரிக்கைகளும் சூழலுக்கேற்ற குரலில் எழுதப்படுகின்றன; எடுத்துக்காட்டாக, விளையாட்டுகளுக்கு உற்சாகமாகவும் நிதிச் சேவைகளுக்கு முறையாகவும் இருக்கும். பயனர் அனுபவம் பயனரின் நோக்கத்தை மதிக்கும்போது, பாதுகாப்புக் கட்டுப்பாடுகளின் ஏற்பு அதிகரித்து, ஜெயில்பிரேக் முயற்சிகள் குறைகின்றன.
கண்காணித்து, ரெட் டீமிங் செய்து, பின்னூட்டச் சுழற்சியை நிறைவு செய்யுங்கள். தொடர்ச்சியான ரெட் டீமிங் மற்றும் நேரடிப் பாதுகாப்புத் தகவல் பலகைகள், பின்னடைவுகள் பயனர்களைப் பாதிக்கும் முன்பே அவற்றைக் கண்டறிய உதவுகின்றன. கூடுதல் ஃப்யூ-ஷாட் எடுத்துக்காட்டுகள் அல்லது வழிமாற்று விதிகளை வழங்கி, எந்தப் புதிய தாக்குதல் முறையையும் மாடலுக்குக் கற்பிக்கலாம். இதனால் பயன்பாட்டின் செயல்திறனைப் பாதிக்காமல், காலப்போக்கில் அமைப்பை உடைப்பது கடினமாகும்.
பயனுள்ள பாதுகாப்புக் கட்டுப்பாடுகளை உருவாக்கிப் பராமரிப்பது கடினம்.
நடைமுறையில், தெளிவாக வரையறுக்கப்பட்ட கொள்கையை உருவாக்க முக்கிய வணிகப் பங்குதாரர்களும் உருவாக்குநர்களும் கவனமாக இணைந்து பணியாற்ற வேண்டும். கொள்கை வரையறுக்கப்பட்டதும், அமைப்பின் வடிவமைப்பையும் நடத்தையையும் உருவாக்கிச் சீரமைக்க வேண்டும்.
gpt-oss-safeguard போன்ற திறந்த பாதுகாப்பு ரீஸனிங் மாடல்களின் வருகை, இந்தச் செயல்முறையில் உள்ள சில சிரமங்களைத் தீர்க்கக்கூடும். அவை உள்ளடக்கக் கட்டுப்பாட்டுக்கு உடனடியாகப் பயன்படுத்தக்கூடிய, பல்திறன் மிக்க அடித்தளத்தை வழங்குகின்றன.
இன்றைய உள்ளடக்கக் கட்டுப்பாட்டு அமைப்புகளை உருவாக்குவதில் பொதுவாக ஏற்படும் சில சவால்களுக்குத் தீர்வளிப்பதை Gpt-oss-safeguard நோக்கமாகக் கொண்டுள்ளது. இந்தச் சிறிய, சிறப்புப் பயன்பாட்டு மாடல்கள், அனுமானச் செயல்பாட்டின்போது இலக்குக் கொள்கையை ஆராய்ந்து முடிவெடுக்க நுண்சீரமைக்கப்பட்டுள்ளன. ஜெயில்பிரேக்குகள், PII வெளிப்பாடு மற்றும் பிற கொள்கை மீறல்கள் போன்ற தீங்கு விளைவிக்கும் அல்லது முக்கியத் தகவல்களை இவை தேடுகின்றன.
வகைப்படுத்தும் செயல்முறையில் ரீஸனிங்கை இணைப்பதால், எளிதில் கடக்க முடியாத, அதிகத் துல்லியமும் உறுதித்தன்மையும் கொண்ட உள்ளடக்கக் கட்டுப்பாட்டை இவை வழங்குகின்றன. GPT-OSS 20B மற்றும் 120B-இன் சிறப்புப் பாதுகாப்புப் பதிப்புகளான இவை, தனிப்பயன் கொள்கை வரையறைகள் மூலம் மிகக் குறைந்த அமைப்புப் பணியுடன் அதிநவீன பாதுகாப்புச் செயல்திறனை வழங்குகின்றன.
நடைமுறைப் பயன்பாட்டை ஒத்த பல பணிகளில் gpt-oss-safeguard 20B மற்றும் 120B மாடல்களை மதிப்பிட்டோம்: நிகழ்நேரக் குரல் உதவியாளர், விளையாட்டுக்குள் வீரர் ஆதரவு வழங்கும் தானியங்கி உரையாடல் அமைப்பு, முன்கூட்டிய அரட்டை உள்ளடக்கக் கட்டுப்பாட்டு அமைப்பு மற்றும் பன்மொழி நச்சுத்தன்மை ஆய்வு (ஸ்பானிஷ், பிரெஞ்சு, இத்தாலியன், போர்த்துகீசியம், ரஷ்யன் மற்றும் துருக்கியம்).
தாமதத்தால் பாதிக்கப்படும் குரல் உள்ளடக்கக் கட்டுப்பாடு: எங்கள் நிகழ்நேரக் குரல் சோதனைகளில், உரையாடலுக்குள்ளேயே பதிலைப் பகுப்பாய்வு செய்து முன்னுரிமைப்படுத்த வேண்டியிருந்தது; விளையாட்டு அரட்டை உள்ளடக்கக் கட்டுப்பாட்டை இதற்கு எடுத்துக்காட்டாகக் கொள்ளலாம். இதில் gpt-oss-safeguard-20B, GPT-OSS-20B மற்றும் GPT-5-Mini இடையேயான துல்லிய இடைவெளியில் சுமார் 80%-ஐக் குறைத்தது (0.45-இலிருந்து 0.71; GPT-5-Mini 0.78). அதேவேளையில் தாமதமும் பெருமளவு குறைந்தது.
வீரர் ஆதரவை மேலாய்வுக்கு அனுப்புதல்: வீரர் ஆதரவு முன்னுரிமைப்படுத்தலில், GPT-OSS-20b மற்றும் GPT-5-Mini இடையேயான இடைவெளியில் சுமார் 90%-ஐ gpt-oss-safeguard-20B குறைத்தது (0.57-இலிருந்து 0.66; GPT-5-Mini 0.67). சோதனைத் தொகுப்பிலேயே சிறந்த ஒட்டுமொத்தத் துல்லியத்தையும், தீங்கற்ற உள்ளடக்கத்தில் 88% மீட்டெடுப்பையும், பாதிப்புக்கு உள்ளாகக்கூடிய பயனர்களைக் கண்டறிவதில் 87% துல்லியத்தையும் இது வழங்கியது. மனித மதிப்பீட்டாளர்களை அளவுக்கு மீறிய செய்திகளால் நிரப்பாமல், மிகுந்த நம்பகத்தன்மையுடன் எச்சரிக்கையாக மேலாய்வுக்கு அனுப்ப இது உதவும்.
பெருமளவில், செறிவான கொள்கைகளைக் கொண்ட அரட்டை உள்ளடக்கக் கட்டுப்பாடு: செறிவான கொள்கை ஆவணத்தின்படி விளையாட்டுச் செய்திகளை முன்கூட்டியே குறிக்க வேண்டிய எங்கள் மிகக் கடினமான மதிப்பீட்டில், gpt-oss-safeguard தெளிவான வித்தியாசத்தில் OSS அடிப்படையை விஞ்சியது. இது சுமார் 35% ஒப்பீட்டு உயர்வைப் பெற்றதுடன், நீண்ட கொள்கைகளையும் திறம்படக் கையாண்டது. அதிக மீட்டெடுப்பும் துல்லியமும் தேவைப்படும், குறிப்பாக நுட்பமான பயன்பாடு இது. மீட்டெடுப்பு மிகவும் குறைவாக இருந்தால், பல தீங்கு விளைவிக்கும் செய்திகள் தவறவிடப்படும். துல்லியம் குறைவாக இருந்தால், பொருத்தமற்ற பல செய்திகள் மனித மதிப்பீட்டாளர்களிடம் அனுப்பப்படும். இதனால் உண்மையிலேயே கடினமான நிகழ்வுகளிலிருந்து அவர்களின் கவனம் சிதறும்.
பன்மொழிச் செயல்திறன்: ஆறு மொழிகளைக் கொண்ட சமநிலையான நச்சுத்தன்மைத் தரவுத்தொகுப்பில், gpt-oss-safeguard பொதுவாகத் துல்லியத்தில் 3–5 சதவீதப் புள்ளிகளுக்குள் GPT-5-Mini-க்கு நிகராகச் செயல்பட்டது. ஸ்பானிஷ் மொழியில் gpt-oss-safeguard-120B சற்றே முன்னிலை பெற்றது. துருக்கியம் போன்ற குறைந்த வளமுள்ள மொழிகளில் சற்றுப் பெரிய இடைவெளிகளைக் கண்டோம். இருப்பினும் ஒட்டுமொத்தமாகப் பன்மொழிச் செயல்திறன் உறுதியாக இருந்தது; 20B-இலிருந்து 120B-க்கு மாறும்போது மீட்டெடுப்பு தொடர்ந்து மேம்பட்டது.
உள்ளடக்கக் கட்டுப்பாட்டில் LLMகள் வழக்கமாகப் பலவீனமாக இருக்கும் PII தரவு போன்ற பகுதிகளிலும் gpt-oss-safeguard மாடல்கள் சிறப்பாகச் செயல்பட்டதைப் பார்த்தோம். பொதுப் பயன்பாட்டு மாடல்கள் அமெரிக்கப் பாணி PII தரவை அடையாளம் காண்பதில் அதிகச் சார்பு கொண்டிருப்பதால், பிற புவியியல் பகுதிகளில் அவற்றின் செயல்திறன் குறைவாக இருக்கும். இதனால், விரிவான பயன்பாட்டுக்கான LLMகளால் கையாள முடியாத சிறிய கொள்கை மீறல்களைக் கண்டறியத் தனிப்பயன் கருவிகளைச் சார்ந்திருப்பதைக் குறைத்து, உள்ளடக்கக் கட்டுப்பாட்டு அமைப்பை gpt-oss-safeguard எளிமைப்படுத்தும் என நம்புகிறோம்.
ஆக, gpt-oss-safeguard-20B மற்றும் gpt-oss-safeguard-120B போன்ற “அடித்தள உள்ளடக்கக் கட்டுப்பாட்டு மாடல்கள்” மிக விரைவாக நல்ல முன்னேற்றத்தை வழங்கும் என்பதை எங்கள் மதிப்பீடுகள் உறுதிப்படுத்தியுள்ளன. இருப்பினும், அமைப்புகளுக்கு மிக உயர்ந்த பாதுகாப்பும் துல்லியமான நோக்கப் பொருத்தமும் தேவைப்படும்போது, துறைசார் நுண்சீரமைப்புகளே இன்னும் உயர்ந்த தரநிலையை நிர்ணயிக்கின்றன.


விளையாட்டுக்குள் உள்ளடக்கக் கட்டுப்பாடு செய்யும் பயன்பாட்டுக்காக, சுமார் 10,000 முந்தைய மதிப்பீட்டாளர் நடவடிக்கைகள் மற்றும் கொள்கை முடிவுகளைக் கொண்டு சூப்பர்வைஸ்ட் ஃபைன்-ட்யூனிங் முறையில் Qwen3-0.6B வகைப்படுத்தியை நுண்சீரமைத்தோம். இந்தப் பணியில் நாங்கள் சோதித்த ஒவ்வொரு அடிப்படை மாடலையும் இந்த மாடல் பெரும் வித்தியாசத்தில் விஞ்சியது. இது 15% உடன் ஒப்பிடும்போது 57% துல்லியத்தைப் பெற்றது (gpt-oss-safeguard-120B; GPT-4.1-nano செயல்திறன் விகிதத்திலிருந்து மதிப்பிடப்பட்டது). இது 42 புள்ளிகள் அல்லது சுமார் 280% உயர்வு. குறியிடப்பட்ட எடுத்துக்காட்டுகளில் பயிற்சியளிக்கப்பட்ட சிறிய, பிரத்யேக வகைப்படுத்திகள், சிறப்புத் துறைகளில் பாதுகாப்பு மாடல்களைவிடச் சிறப்பாகச் செயல்படலாம் என்ற OpenAI வழிகாட்டுதலுடன் இந்த முடிவுகள் ஒத்துப்போகின்றன.
இதன் முக்கியப் பாடம் தெளிவானது: கொள்கைகள் நுட்பமானவையாகவும் ஏராளமான விளிம்பு நிலைகளைக் கொண்டவையாகவும் இருக்கும்போது, துறைக்கேற்ப சீரமைக்கப்பட்ட சிறிய மாடலே இன்னும் தலைசிறந்த தரநிலையாக உள்ளது. நுண்சீரமைப்பு உங்கள் கொள்கையையும் விளிம்பு நிலைகளையும் நேரடியாக அளவுருக்களில் பதிப்பதால், நடைமுறைப் பயன்பாட்டின் சிக்கலான சூழல்களிலும் மாடல் சீராகச் செயல்படுகிறது; தாமதமும் செலவும் மிகக் குறைவாகவே இருக்கும்.
இதற்கான பல அணுகுமுறைகளில் சூப்பர்வைஸ்ட் ஃபைன்-ட்யூனிங் ஒன்றே ஒன்று மட்டுமே. மாடலின் நடத்தையை மேலும் மேம்படுத்த, ரீஇன்ஃபோர்ஸ்மென்ட் லெர்னிங் அல்லது நடப்புக் கொள்கை வடித்தல் போன்ற பிற ஆற்றல்மிக்க பயிற்சி நுட்பங்களையும் பயன்படுத்தலாம்.
நுண்சீரமைப்புக்குப் பொதுவாகப் பெருமளவு தரவு தேவைப்படும். இந்த Qwen3-0.6B வகைப்படுத்தியை நுண்சீரமைக்கப் பயன்படுத்திய தரவுத்தொகுப்பை மனித மதிப்பீட்டாளர்கள் கைமுறையாகக் குறியிட்டிருந்தனர். எனவே அது தூய்மையான, நம்பகமான உண்மை ஆதாரமாக இருந்தது.
பல திட்டங்களின் தொடக்கத்தில் இத்தகைய செறிவான தரவின் அனுகூலம் கிடைக்காமல் இருக்கலாம். எனவே, ஒரு தீர்வின் உருவாக்கச் சுழற்சியில் பின்னர் மேற்கொள்ளக்கூடிய மேம்பாடாகவே நுண்சீரமைப்பை நாங்கள் பொதுவாகக் கருதுகிறோம். தீர்வின் வடிவம் நிலைபெற்று, உண்மையான பயனர் தரவு ஓரளவு சேகரிக்கப்பட்டதும், உள்ளடக்கக் கட்டுப்பாட்டுத் தீர்வுகளை அடுத்த நிலைக்குக் கொண்டுசெல்ல இலக்கு சார்ந்த நுண்சீரமைப்பைப் பரிசீலிக்க உருவாக்குநர்கள் தொடங்கலாம்.
gpt-oss-safeguard போன்ற அடித்தள உள்ளடக்கக் கட்டுப்பாட்டு மாடல்கள் ஆற்றல்மிக்க புதிய கட்டுமானக் கூறுகளாகும். நிகழ்நேரப் பயன்பாடுகளின் தாமதத்தைக் குறைப்பதோடு, உள்ளடக்கக் கட்டுப்பாட்டு அமைப்புகளின் வடிவமைப்பையும் இவை கணிசமாக எளிமைப்படுத்தக்கூடும். இவற்றுடன் சிறிய, தேவைக்கேற்ப உருவாக்கப்பட்ட வகைப்படுத்திகளை இணைத்தால், பெரிய பொதுப் பயன்பாட்டு மாடல்களைப் ப்ராம்ப்ட் மூலம் இயக்கும் அணுகுமுறையைவிடக் குறைவான இயங்கு கூறுகளுடன் பாதுகாப்பான, வேகமான அமைப்பை உருவாக்கலாம்.
இன்று உள்ளடக்கக் கட்டுப்பாட்டு அமைப்பை நிறுவவோ மேம்படுத்தவோ விரும்பினால், முதலில் gpt-oss-safeguard போன்ற மாடல்களுடன் தொடங்கி செயல்திறனை அளவிடுங்கள். தரவு இடைவெளிகளைக் காட்டும் இடங்களில், தேவைக்கேற்ப உருவாக்கப்பட்ட வகைப்படுத்திகள் மூலம் இலக்கு சார்ந்த மேம்பாடுகளைச் சேருங்கள்; அவை ப்ராம்ப்ட் சார்ந்தவையாகவோ நுண்சீரமைக்கப்பட்டவையாகவோ இருக்கலாம்.
மேலும் அறிய விரும்புகிறீர்களா? எங்களுக்கு ஒரு செய்தி அனுப்புங்கள்.