Соңғы екі жылда біз миллиондаған пайдаланушыға қауіпсіз қызмет көрсете алатын шешімдер жасадық. Бұл жұмыстың маңызды бөлігі жылдам әрі дәл модерация жүйелерін жобалау болды. Тиімді модерация компанияларға озық ЖИ шешімдерін сеніммен енгізуге мүмкіндік береді: қажетсіз генерацияларды проблемаға айналмай тұрып анықтап, пайдаланушыларды зияннан және брендті беделге нұқсан келуінен қорғайды.
Жақында OpenAI GPT-OSS-Safeguard модельдерін шығарды. Бұлар — биыл ертерек таныстырылған 20B және 120B OSS модельдерінің дәл бапталған нұсқалары. Бұл модельдер пайдаланушы саясатын тікелей инференс кезінде түсіндіре алады, сөйтіп контент модерациясының икемді әрі қуатты тәсілін ұсынады. Бұл модельдер әзірге зерттеуге арналған алдын ала нұсқада, сондықтан уақыт өте жетіле беретіні сөзсіз.
Осы шығарылым алдында біз OpenAI-мен бірлесіп, модельді дамытуға қажет нақты ортадағы бағалауларды жүргіздік. Бұл мақалада сол ынтымақтастықтан түйгенімізбен бөлісіп, осы жетістіктердің өндірістік ЖИ жүйелеріндегі модерация болашағына ықпалын қарастырамыз.
Бүгінде модерация шешімдері әдетте қолданбаны қоршайтын бірнеше қорғаныс қабаты түрінде құрылады. Біз бұл үлгіні пайдаланушысы көп, көпшілікке арналған жүйелерде жиі қолданамыз. Толығырақ білгіңіз келсе, осы тақырыптағы блогымызды мына жерден оқыңыз.
Кірістерді қатар жіктеңіз (зиянды көмексөздерді өткізбеңіз): Шағын, нақты тақырыпқа арналған жіктеуіштер әр пайдаланушы хабарын бір уақытта таңбалайды. Біздің байқауымызша, аясы тар жіктеуіштер бәрін қамтитын бір жіктеуішке қарағанда айтарлықтай сенімді. Көмексөзге мұқият таңдалған аз мысалмен үйрету үлгілерін қосу “I keep getting killed by this boss” (ойын контексті, мүлде зиянсыз) деген сөзді нақты өмірдегі зиян белгісінен ажыратуға көмектеседі.
Қауіпсіз → Қалыпты түрде генерациялау
Қорғанысты айналып өту үлгілері → Елемеу немесе бренд стиліндегі бас тарту жауабымен тойтару
Қауіпсіздікке не әл-ауқатқа қатер → толық контекстпен маманға жіберу
Шығыстарды жіктеңіз (зиянды жауапты жібермеңіз): Әр ықтимал жауап жіберілер алдында қайта тексеріледі. Бұл модель ауытқуынан, RAG деректерінің улануынан және зиянды контент, жеке сәйкестендіретін деректердің (PII) ашылуы не құпия ақпараттың таралуы сияқты саясаттың күрделі шеткі жағдайларынан қорғайды. Жауап белгіленсе, кейін өкінетін нәрсені жібермей, LLM (үлкен тілдік модель) жасаған жауапты қауіпсіз, брендке сай хабармен алмастырамыз немесе маманға жолдаймыз.
Жылдам әрі қолжетімді етіңіз: Көмексөздерді қайта қолданылатын блоктар түрінде құру олардың үзінділерін, жіктеуіштің аз мысалмен үйрету үлгілерін және диалогтің жиі кездесетін бастамаларын кэштеуге мүмкіндік береді. Бұл тәсіл қорғаныс тетіктерінің кідірісі мен құнын азайтуға мүмкіндік береді.
Қауіпсіздікті өнімнің бір бөлігі деп қарастырыңызБас тарту жауаптары мен ескертулер тиісті стильде жазылады (мысалы, ойындарда — әзілмен, қаржы саласында — ресми түрде). Пайдаланушы тәжірибесі оның ниетін ескерсе, қорғаныс тетіктерін қабылдау артып, қорғанысты айналып өту әрекеттері азаяды.
Бақылаңыз, редтиминг жүргізіңіз және кері байланыс циклін тұйықтаңызҮздіксіз редтиминг пен нақты уақыттағы қауіпсіздік дашбордтары ақауларды пайдаланушыларға жетпей тұрып анықтауға көмектеседі. Қосымша аз мысалмен үйрету үлгілері және/немесе бағыттау ережелері арқылы модельге кез келген жаңа шабуыл үлгісін таныта аламыз. Осылайша қолданба өнімділігі төмендемей, уақыт өте жүйені бұзу қиындайды.
Тиімді қорғаныс тетіктерін жасау және қолдау қиын.
Іс жүзінде нақты тұжырымдалған саясат жасау үшін бизнестегі негізгі мүдделі тараптар мен әзірлеушілердің мұқият ынтымақтастығы қажет. Саясат анықталғаннан кейін жүйенің құрылымы мен әрекетін жасап, баптау керек.
gpt-oss-safeguard секілді ашық қауіпсіздік және ой қорыту модельдерінің пайда болуы осы үдерістегі кейбір қиындықтарды шешіп, контент модерациясына қолдануға дайын әрі әмбебап негіз ұсына алады.
Gpt-oss-safeguard қазіргі модерация жүйелерін жасау кезінде жиі кездесетін кейбір қиындықтарды шешуге бағытталған. Бұл шағын, арнайы модельдер инференс кезінде мақсатты саясатты талдап, қорғанысты айналып өту үлгілері, PII деректерінің ашылуы және өзге саясат бұзушылықтары сияқты зиянды не құпия контентті анықтауға дәл бапталған.
Жіктеу үдерісіне ой қорытуды қосу арқылы олар дәлірек, төзімдірек әрі айналып өту қиынырақ модерацияны қамтамасыз етеді. GPT-OSS 20B және 120B модельдерінің арнайы қауіпсіздік нұсқалары ретінде олар теңшелетін саясат анықтамаларының арқасында аз ғана бастапқы баптаумен озық қауіпсіздік нәтижесін ұсынады.
Біз gpt-oss-safeguard 20B және 120B модельдерін өндірістік ортаға ұқсас бірнеше тапсырмада бағаладық: нақты уақыттағы дауыстық көмекші, ойын ішіндегі ойыншыларды қолдау боты, проактивті чат модерациясы және алты тілдегі уытты контентті анықтау (испан, француз, итальян, португал, орыс және түрік тілдері).
Кідіріске сезімтал дауыстық модерация: Нақты уақыттағы дауыс сынақтарында (мысалы, ойын чатын модерациялау секілді жауапты әңгіме барысында талдап, санатқа бөлу қажет болғанда) gpt-oss-safeguard-20B GPT-OSS-20B мен GPT-5-Mini арасындағы дәлдік алшақтығының шамамен 80%-ын жапты (0,45-тен 0,71-ге дейін өсті, GPT-5-Mini — 0,78), әрі кідірісі әлдеқайда аз болды.
Ойыншыларды қолдау өтініштерін бағыттау: Ойыншыларды қолдау өтініштерін сұрыптауда gpt-oss-safeguard-20B моделі GPT-OSS-20b мен GPT-5-Mini арасындағы алшақтықтың шамамен 90%-ын жапты (0,57-ден 0,66-ға дейін өсті, GPT-5-Mini — 0,67). Сондай-ақ ол жиынтықтағы ең жоғары макронақтылықты, зиянсыз контентті анықтауда 88% толықтықты және осал пайдаланушыларды анықтауда 87% дәлдікті көрсетті. Бұл мамандарды артық хабарламаға көміп тастамай, сақ әрі сенімді бағыттау қажет болғанда пайдалы.
Күрделі саясатқа негізделген ауқымды чат модерациясы: Модерация жүйесі күрделі саясат құжатына сай ойын ішіндегі хабарларды проактивті түрде белгілеуге тиіс ең қиын бағалауымызда gpt-oss-safeguard OSS базалық моделінен айқын басым түсіп, салыстырмалы түрде шамамен 35% өсім көрсетті және ұзақ саясаттарды тиімді өңдеді. Бұл — толықтық пен дәлдік жоғары болуға тиіс аса сезімтал қолдану жағдайы. Толықтық тым төмен болса, көптеген зиянды хабар анықталмай қалады. Ал дәлдік төмен болса, көптеген қатысы жоқ хабар модераторларға жіберіліп, олардың назарын шынымен күрделі жағдайлардан бұрады.
Көптілді өнімділік: Алты тілдегі теңгерілген уытты контент деректер жиынында gpt-oss-safeguard нәтижесі GPT-5-Mini-ге жақын болды: дәлдік айырмасы әдетте 3–5 пайыздық тармақты құрады, ал испан тілінде gpt-oss-safeguard-120B сәл озық шықты. Түрік тілі сияқты ресурсы аз тілдерде айырмашылық сәл үлкен болды. Дегенмен жалпы алғанда көптілді өнімділік тұрақты болып, 20B-ден 120B-ге көшкенде толықтық жүйелі түрде артты.
Сондай-ақ gpt-oss-safeguard модельдері LLM (үлкен тілдік модель) жүйелері модерацияда дәстүрлі түрде әлсіз саналатын салаларда, соның ішінде PII деректерін анықтауда жоғары нәтиже көрсетті. Көпшілік модельдер АҚШ үлгісіндегі PII деректерін анықтауға көбірек бейім болып, басқа өңірлерде әлсіздеу жұмыс істейді. Сондықтан gpt-oss-safeguard кең ауқымды LLM (үлкен тілдік модель) жүйелері анықтай алмайтын ұсақ саясат бұзушылықтарын табуға арналған арнайы құралдарға тәуелділікті азайтып, модерацияны реттеуді жеңілдетеді деп санаймыз.
Сонымен, бағалауымыз gpt-oss-safeguard-20B және gpt-oss-safeguard-120B секілді «модерацияның іргелі модельдері» арқылы аз уақытта айтарлықтай нәтижеге жетуге болатынын көрсетті. Алайда жүйелерден қауіпсіздік пен нақтылықтың ең жоғары деңгейі талап етілгенде, белгілі бір салаға бейімдеп дәл бапталған модельдер әлі де үздік өлшем саналады.


Ойын ішіндегі модерация үшін біз модераторлардың шамамен 10 мың тарихи әрекеті мен саясат нәтижесін пайдаланып, Qwen3-0.6B жіктеуішін қадағаланатын баптау арқылы дәл баптадық. Бұл модель осы тапсырмада біз сынаған барлық базалық модельден едәуір озып, 15%-бен салыстырғанда 57% дәлдікке жетті (gpt-oss-safeguard-120B нәтижесі GPT-4.1-nano көрсеткішінің арақатынасы бойынша бағаланды): өсім — 42 пайыздық тармақ немесе шамамен 280%. Бұл нәтижелер таңбаланған мысалдармен үйретілген шағын, арнайы жіктеуіштер мамандандырылған салаларда қорғаныс модельдерінен оза алады деген OpenAI нұсқаулығына сай келеді.
Қорытынды анық: саясат күрделі әрі шеткі жағдайлар көп болса, салаға бейімделген шағын модель әлі де ең үздік шешім. Дәл баптау саясат пен шеткі жағдайларды модель параметрлеріне тікелей енгізеді. Нәтижесінде нақты өндірістік ортада модель тұрақтырақ жұмыс істеп, кідіріс пен шығын өте аз болады.
Қадағаланатын баптау — мұны іске асырудың бірнеше тәсілінің бірі ғана. Модель әрекетін одан әрі оңтайландыру үшін күшейтпелі оқыту немесе ағымдағы саясат негізіндегі дистилляция сияқты өзге де қуатты оқыту әдістерін қолдануға болады.
Дәл баптау үшін әдетте көп дерек қажет. Бұл Qwen3-0.6B жіктеуішін дәл баптауға пайдаланылған деректер жиынын модераторлар қолмен таңбалаған, сондықтан ол сапалы әрі сенімді ақиқат көзі болды.
Көптеген жобада бастапқы кезде мұндай мол әрі сапалы дерек болмауы мүмкін. Сондықтан дәл баптауды шешімді әзірлеу циклінің кейінгі кезеңінде жасалатын оңтайландыру деп қарастырамыз. Шешімнің құрылымы тұрақтанып, нақты пайдаланушылардан біраз дерек жиналған соң, әзірлеушілер модерация шешімдерін жаңа деңгейге көтеру үшін мақсатты дәл баптауды қолдана алады.
gpt-oss-safeguard секілді модерацияның іргелі модельдері — жаңа әрі қуатты құрылыс блоктары. Олар модерация жүйелерін жобалауды едәуір жеңілдетіп, нақты уақыттағы қолданбалардың кідірісін азайта алады. Оларды шағын, арнайы жіктеуіштермен біріктірсеңіз, ірі әмбебап модельдер мен көмексөздерге негізделген тәсілге қарағанда құрамдасы аз, қауіпсіз әрі жылдам жүйе құра аласыз.
Егер қазір модерация жүйесін іске қосып немесе жаңартып жатсаңыз, алдымен gpt-oss-safeguard секілді модельдерді қолданып, өнімділігін өлшеңіз. Деректер олқылықтарды көрсеткен тұстарда арнайы жіктеуіштермен — көмексөзге негізделген не дәл бапталған — мақсатты жақсартулар енгізіңіз.
Көбірек білгіңіз келе ме? Бізге хабарласыңыз.