Le dhá bhliain anuas, tá réitigh tógtha againn a leathnaíodh go sábháilte chuig na milliúin úsáideoirí. Cuid lárnach den obair seo ab ea córais mhodhnóireachta thapa chruinne a dhearadh. Cuireann modhnóireacht éifeachtach ar chumas cuideachtaí réitigh cheannródaíocha IS a imscaradh go muiníneach, úsáideoirí deiridh a chosaint ar dhíobháil agus sábháilteacht an bhranda a chinntiú trí ábhar neamh-inmhianaithe ginte a aimsiú sula mbíonn sé ina fhadhb.
Le déanaí, d’eisigh OpenAI a samhlacha GPT-OSS-Safeguard: leaganacha mionchoigeartaithe de na samhlacha OSS 20B agus 120B a tugadh isteach níos luaithe i mbliana. Is féidir leis na samhlacha seo beartas úsáideora a léirmhíniú go díreach tráth tátail, rud a chuireann cur chuige solúbtha cumhachtach ar fáil maidir le modhnóireacht inneachair. Tá na samhlacha seo i réamhamharc taighde, mar sin is cinnte go leanfaidh siad ag feabhsú.
Chomhoibríomar le OpenAI roimh an eisiúint seo, agus rinneamar meastóireachtaí sa saol iarbhír chun cabhrú le forbairt na samhla. San alt seo, roinnimid léargais ón gcomhoibriú sin agus scrúdaímid a bhfuil i gceist leis na dul chun cinn seo do thodhchaí na modhnóireachta i gcórais IS táirgthe.
Sa lá atá inniu ann, is gnách réitigh mhodhnóireachta a dhearadh mar shraitheanna cosanta timpeall an fheidhmchláir. Bainimid úsáid mhór as an bpatrún seo in imscaradh poiblí ardtoirte. Le haghaidh tuilleadh sonraí, léigh ár mblag faoi seo anseo.
Aicmigh ionchuir go comhthreomhar (ná lig drochleideanna isteach): Ritheann aicmitheoirí beaga sainábhair ag an am céanna chun gach teachtaireacht úsáideora a lipéadú. Fuaireamar amach go mbíonn aicmitheoirí a bhfuil fócas cúng acu níos iontaofa go hinbhraite ná aicmitheoir aonair uileghabhálach. Is féidir le samplaí beagiarrachta a roghnaítear go cúramach sa leid cabhrú le hidirdhealú a dhéanamh idir “I keep getting killed by this boss” (comhthéacs cluiche, go hiomlán neamhdhíobhálach) agus comhartha díobhála sa saol iarbhír.
Sábháilte → Gin mar is gnách
Iarrachtaí jailbreak → Déan neamhaird díobh nó seachain iad le diúltú atá ag teacht leis an mbranda
Rioscaí sábháilteachta nó folláine → cuir faoi bhráid duine iad agus comhthéacs saibhir ag gabháil leo
Aicmigh aschuir (ná seol drochfhreagra): Déantar gach freagra féideartha a scagadh arís sula seoltar é. Cosnaíonn sé seo ar dhiall samhla, nimhiú sonraí RAG agus cásanna imeallacha caolchúiseacha beartais, amhail ábhar díobhálach, nochtadh PII nó sceitheadh faisnéise íogaire. Má mharcáiltear é, cuirimid teachtaireacht shábháilte atá ag teacht leis an mbranda in ionad an fhreagra a ghin LLM, nó cuirimid faoi bhráid duine é, seachas rud a sheoladh a mbeidh aiféala orainn faoi.
Déan tapa agus inacmhainne é: Má thógtar leideanna mar bhloic in-athúsáidte, is féidir blúirí leide, samplaí beagiarrachta aicmitheora agus réimíreanna coitianta dialóige a thaisceadh. Leis an gcur chuige seo, is féidir moill agus costas do chosaintí a laghdú.
Caith le sábháilteacht mar chuid den táirge: Scríobhtar diúltuithe agus rabhaidh i nguth an bhranda (m.sh., spraíúil do chluichí, foirmiúil don airgeadas). Nuair a urramaíonn eispéireas an úsáideora rún an úsáideora, glactar níos fearr le cosaintí agus laghdaítear iarrachtaí jailbreak.
Déan monatóireacht agus tástáil ionsaitheach, agus cuir an lúb i gcrích: Cabhraíonn tástáil ionsaitheach leanúnach agus deais bheo sábháilteachta le cúlchéimnithe a aimsiú sula dtéann siad i bhfeidhm ar úsáideoirí. Is féidir linn patrúin nua ionsaithe a mhúineadh don tsamhail trí shamplaí breise beagiarrachta agus/nó rialacha ródaithe a sholáthar, ionas gur deacra an córas a shárú le himeacht ama gan cur isteach ar fheidhmíocht an fheidhmchláir.
Is deacair cosaintí éifeachtacha a thógáil agus a chothabháil.
Go praiticiúil, teastaíonn comhoibriú cúramach idir príomhpháirtithe leasmhara an ghnó agus forbróirí chun beartas soiléir a chruthú. Ansin, nuair atá an beartas sainithe, ní mór dearadh agus iompar an chórais a fhorbairt agus a thiúnáil.
D’fhéadfadh samhlacha oscailte réasúnaíochta sábháilteachta amhail gpt-oss-safeguard cuid de dheacrachtaí an phróisis seo a réiteach, trí bhonn níos solúbtha agus níos réidhe le húsáid a sholáthar do mhodhnóireacht inneachair.
Tá sé mar aidhm ag gpt-oss-safeguard dul i ngleic le cuid de na dúshláin choitianta a bhaineann le córais mhodhnóireachta an lae inniu a thógáil. Déantar na samhlacha beaga speisialaithe seo a mhionchoigeartú chun réasúnaíocht a dhéanamh bunaithe ar spriocbheartas tráth tátail, agus iad ag lorg ábhar díobhálach nó íogair amhail ionsaithe jailbreak, nochtadh PII agus sáruithe eile beartais.
Trí réasúnaíocht a ionchorprú ina bpróiseas aicmithe, soláthraíonn siad modhnóireacht níos cruinne agus níos athléimní ar deacra í a shárú. Mar leaganacha speisialaithe sábháilteachta de GPT-OSS 20B agus 120B, cuireann siad feidhmíocht sábháilteachta den chéad scoth ar fáil agus ní éilíonn siad ach fíorbheagán oibre socraithe trí shainmhínithe beartais saincheaptha.
Rinneamar meastóireacht ar gpt-oss-safeguard 20B agus 120B i roinnt tascanna a léiríonn timpeallachtaí táirgthe: cúntóir gutha fíor-ama, bota tacaíochta d’imreoirí laistigh de chluiche, córas réamhghníomhach modhnóireachta comhrá agus scagadh tocsaineachta ilteangach (Spáinnis, Fraincis, Iodáilis, Portaingéilis, Rúisis agus Tuircis).
Modhnóireacht ghutha atá íogair do mhoill: Inár dtástálacha gutha fíor-ama—mar shampla, aicmiú beo laistigh de chomhrá ina gcaithfear freagra a anailísiú agus a thriáiseáil, amhail modhnóireacht comhrá le linn cluiche—dhún gpt-oss-safeguard-20B thart ar 80% den bhearna chruinnis idir GPT-OSS-20B agus GPT-5-Mini (0.71 i gcomparáid le 0.78, suas ó 0.45), agus moill i bhfad níos ísle aige.
Ardú céime i dtacaíocht d’imreoirí: I dtriáis tacaíochta d’imreoirí, dhún gpt-oss-safeguard-20B thart ar 90% den bhearna idir GPT-OSS-20b agus GPT-5-Mini (0.66 i gcomparáid le 0.67, suas ó 0.57). Bhain sé amach freisin an macrabheachtas ab fhearr sa ghrúpa, aisghairm 88% ar ábhar neamhurchóideach agus beachtas 87% maidir le húsáideoirí leochaileacha a bhrath—úsáideach más mian leat cásanna a chur faoi bhráid daoine go coimeádach iontaofa gan na hathbhreithneoirí daonna a bhá.
Modhnóireacht comhrá ar scála faoi bheartas dlúth: Sa mheastóireacht ba dhúshlánaí againn, ina gcaithfidh córas modhnóireachta teachtaireachtaí laistigh de chluiche a mharcáil go réamhghníomhach de réir cáipéis dhlúth beartais, sháraigh gpt-oss-safeguard bunlíne OSS go soiléir, le méadú coibhneasta thart ar 35%, agus láimhseáil sé beartais fhada go héifeachtach. Is cás úsáide fíoríogair é seo a éilíonn ardaisghairm agus ardchruinneas. Má bhíonn an aisghairm ró-íseal, caillfear go leor teachtaireachtaí díobhálacha. Dá mbeadh an beachtas íseal, mharcálfaí go leor teachtaireachtaí nach mbaineann le hábhar do mhodhnóirí daonna, rud a tharraingeodh a n-aird ó na cásanna fíordheacra.
Feidhmíocht ilteangach: Ar thacar cothromaithe sonraí tocsaineachta i sé theanga, bhí gpt-oss-safeguard gar do GPT-5-Mini, de ghnáth laistigh de 3–5 phointe céatadáin ó thaobh cruinnis de, agus bhí gpt-oss-safeguard-120B beagán chun tosaigh sa Spáinnis. Chonaiceamar bearnaí beagán níos mó i dteangacha ar lú a gcuid acmhainní, amhail an Tuircis, ach ar an iomlán bhí an fheidhmíocht thrasteangach láidir, agus tháinig méadú comhsheasmhach ar aisghairm agus 120B á úsáid in ionad 20B.
Thugamar faoi deara freisin go bhfeidhmíonn samhlacha gpt-oss-safeguard go láidir i réimsí ina mbíonn samhlacha LLM níos laige go traidisiúnta ó thaobh modhnóireachta de, amhail sonraí PII. Is gnách do shamhlacha príomhshrutha bheith claonta i dtreo sonraí PII de chineál SAM a aithint agus feidhmiú níos laige i réigiúin eile. Dá bhrí sin, creidimid go mbeidh gpt-oss-safeguard úsáideach chun socruithe modhnóireachta a shimpliú, trí spleáchas ar uirlisí saincheaptha a laghdú chun sáruithe beaga beartais nach féidir le samhlacha LLM níos leithne a láimhseáil a aimsiú.
Léirigh ár meastóireachtaí gur féidir dul chun cinn mór tapa a dhéanamh le ‘samhlacha bonn modhnóireachta’ amhail gpt-oss-safeguard-20B agus gpt-oss-safeguard-120B. Mar sin féin, is iad mionchoigeartuithe sainréimse an caighdeán is airde fós nuair a éilíonn córais an tsábháilteacht agus an tsainiúlacht is fearr.


Don chás úsáide modhnóireachta sa chluiche, rinneamar mionchoigeartú ar aicmitheoir Qwen3-0.6B trí mhionchoigeartú faoi mhaoirseacht, bunaithe ar thart ar 10,000 gníomh modhnóra agus toradh beartais stairiúil. Sáraíonn an tsamhail seo gach bunsamhail a thástálamar ar an tasc seo go mór: bhain sí cruinneas 57% amach i gcomparáid le 15% (gpt-oss-safeguard-120B, measta ó chóimheas fheidhmíocht GPT-4.1-nano), méadú 42 pointe, nó thart ar 280%. Tá na torthaí seo ag teacht le treoir OpenAI gur féidir le haicmitheoirí beaga tiomnaithe, arna n-oiliúint ar shamplaí lipéadaithe, feidhmiú níos fearr ná samhlacha cosanta i sainréimsí.
Tá an chonclúid soiléir: nuair atá beartais miondifriúil agus go leor cásanna imeallacha iontu, is í samhail bheag atá tiúnáilte don réimse an caighdeán óir fós. Leis an mionchoigeartú, ionchódaítear do bheartas agus na cásanna imeallacha sna paraiméadair féin, rud a thugann iompar níos seasmhaí i dtimpeallacht chasta an táirgthe agus fíorbheagán moille agus costais.
Níl sa mhionchoigeartú faoi mhaoirseacht ach ceann amháin de roinnt cur chuige féideartha. Is féidir leas a bhaint freisin as teicnící cumhachtacha eile oiliúna, amhail foghlaim atreisiúcháin nó driogadh de réir beartais, chun iompar na samhla a bharrfheabhsú tuilleadh.
De ghnáth, teastaíonn cuid mhór sonraí le haghaidh mionchoigeartaithe. Bhí an tacar sonraí a úsáideadh chun an t-aicmitheoir Qwen3-0.6B seo a mhionchoigeartú lipéadaithe de láimh ag modhnóirí daonna, agus dá bhrí sin ba fhoinse iontaofa ghlan fírinne é.
I mórán tionscadal, seans nach mbeidh an buntáiste seo de shonraí saibhre ar fáil ón tús. Dá bhrí sin, is gnách linn féachaint ar mhionchoigeartú mar bharrfheabhsú is féidir a dhéanamh níos déanaí i saolré forbartha réitigh. Nuair atá dearadh an réitigh cobhsaí agus roinnt sonraí ó fhíorúsáideoirí bailithe, is féidir le forbróirí mionchoigeartú spriocdhírithe a úsáid chun a réitigh mhodhnóireachta a fheabhsú tuilleadh.
Is bloic thógála nua chumhachtacha iad samhlacha bonn modhnóireachta amhail gpt-oss-safeguard. D’fhéadfaidís dearadh córas modhnóireachta a shimpliú go mór agus an mhoill in feidhmchláir fíor-ama a laghdú. Má chomhcheanglaítear iad le haicmitheoirí beaga saincheaptha, is féidir córas níos sábháilte agus níos tapúla a chruthú, ina bhfuil níos lú páirteanna ná i gcur chuige bunaithe ar leideanna le samhlacha móra ginearálta.
Má tá córas modhnóireachta á chur ar bun nó á uasghrádú agat inniu, smaoinigh ar thosú le samhlacha amhail gpt-oss-safeguard, tomhais a bhfeidhmíocht, agus cuir feabhsuithe spriocdhírithe le haicmitheoirí saincheaptha—bunaithe ar leideanna nó mionchoigeartaithe—áit a léiríonn na sonraí bearnaí.
Ar mhaith leat tuilleadh eolais a fháil? Seol teachtaireacht chugainn.