Galvenā navigācija

Ko OpenAI gpt-oss-safeguard modeļi nozīmē MI drošībai

OpenAI gpt-oss-safeguard modeļu sākotnējais novērtējums rāda, kā specializēti drošības modeļi var stiprināt produkcijas MI sistēmas.

Pēdējo divu gadu laikā esam izveidojuši risinājumus, kas droši mērogoti līdz miljoniem lietotāju. Būtiska šī darba daļa bija ātru un precīzu moderēšanas sistēmu izstrāde. Efektīva moderēšana ļauj uzņēmumiem pārliecinoši ieviest progresīvus MI risinājumus, pasargājot galalietotājus no kaitējuma un zīmola reputāciju — konstatējot nevēlamu saturu, pirms tas kļūst par problēmu.

Nesen OpenAI izlaida GPT-OSS-Safeguard modeļus — šā gada sākumā ieviesto 20B un 120B OSS modeļu pielāgotās versijas. Šie modeļi izsecināšanas laikā var tieši interpretēt lietotāja politiku, piedāvājot elastīgu un jaudīgu pieeju satura moderēšanai. Šie modeļi ir pieejami izpētes priekšskatījumā, tāpēc laika gaitā tie neapšaubāmi turpinās pilnveidoties.

Pirms modeļu izlaišanas mēs sadarbojāmies ar OpenAI un veicām novērtējumus reālos apstākļos, lai palīdzētu modeļu izstrādē. Šajā rakstā dalāmies ar sadarbībā gūtajām atziņām un aplūkojam, ko šie sasniegumi nozīmē moderēšanas nākotnei produkcijas MI sistēmās.

Kā moderēšana pašlaik darbojas produkcijas vidē?

Mūsdienās moderēšanas risinājumus parasti veido kā lietotni aptverošus aizsardzības slāņus. Šo pieeju bieži izmantojam publiski pieejamās sistēmās ar lielu slodzi. Plašāku informāciju varat lasīt mūsu emuāra rakstā šeit.

  1. Paralēli klasificējiet ievades datus (neielaist kaitīgas uzvednes): Nelieli, konkrētām tēmām paredzēti klasifikatori vienlaikus marķē katru lietotāja ziņojumu. Esam konstatējuši, ka šauri specializēti klasifikatori ir izmērāmi uzticamāki par vienu universālu klasifikatoru. Rūpīgi izvēlēti dažpiemēru piemēri uzvednē var palīdzēt atšķirt „I keep getting killed by this boss” (spēles konteksts, pilnīgi nekaitīgi) no signāla par reālu apdraudējumu.

    • Droši → ģenerēt kā parasti

    • Ierobežojumu apiešana → ignorēt vai novirzīt ar zīmola stilam atbilstošu atteikumu

    • Drošības vai labbūtības riski → nodot cilvēkam, pievienojot plašu kontekstu

  2. Klasificējiet izvades datus (nenosūtīt sliktu atbildi): Pirms nosūtīšanas katra iespējamā atbilde tiek pārbaudīta vēlreiz. Tas aizsargā pret modeļa novirzi, RAG datu saindēšanu un smalkiem politikas robežgadījumiem, piemēram, kaitīgu saturu, personu identificējošas informācijas atklāšanu vai sensitīvas informācijas noplūdi. Ja atbilde tiek atzīmēta, LVM ģenerēto atbildi aizstājam ar drošu, zīmola stilam atbilstošu ziņojumu vai nododam to cilvēkam, nevis nosūtām ko tādu, ko vēlāk nožēlosim.

  3. Padariet sistēmu ātru un ekonomisku: Veidojot uzvednes kā atkārtoti izmantojamus blokus, var kešot uzvedņu fragmentus, klasifikatoru dažpiemēru piemērus un bieži izmantotus dialogu sākumus. Šī pieeja ļauj samazināt gan aizsargmehānismu latentumu, gan izmaksas.

  4. Uztveriet drošību kā produkta saskarnes daļu Atteikumi un brīdinājumi tiek rakstīti atbilstošā stilā, piemēram, rotaļīgi spēlēm un formāli finanšu pakalpojumiem. Ja lietotāja pieredzē tiek respektēts lietotāja nolūks, aizsargmehānismi tiek pieņemti labāk un ierobežojumu apiešanas mēģinājumu kļūst mazāk.

  5. Uzraugiet, veiciet imitētus uzbrukumus un noslēdziet atgriezeniskās saites ciklu Nepārtraukti imitēti uzbrukumi un reāllaika drošības informācijas paneļi palīdz atklāt regresijas, pirms tās skar lietotājus. Varam iemācīt modelim atpazīt jaunus uzbrukumu modeļus, pievienojot dažpiemēru piemērus un/vai maršrutēšanas kārtulas, lai laika gaitā sistēmu būtu arvien grūtāk uzlauzt, nepasliktinot lietotnes veiktspēju.

Mūsdienu moderēšanas risinājumu izstrādes izaicinājumi

Efektīvus aizsargmehānismus izveidot un uzturēt ir grūti.

Praksē skaidri definētas politikas izveidei vajadzīga rūpīga sadarbība starp galvenajām biznesā ieinteresētajām pusēm un izstrādātājiem. Kad politika ir definēta, jāizstrādā un jāpielāgo sistēmas uzbūve un darbība.

Tādi atvērtie drošības spriestspējas modeļi kā gpt-oss-safeguard var novērst dažus šī procesa sarežģījumus, nodrošinot lietošanai gatavāku un daudzpusīgāku pamatu satura moderēšanai.

Specializēto drošības modeļu potenciāls

Gpt-oss-safeguard mērķis ir risināt dažus mūsdienu moderēšanas sistēmu izstrādē bieži sastopamos izaicinājumus. Šie nelielie, specializētie modeļi ir pielāgoti, lai izsecināšanas laikā izvērtētu mērķa politiku un meklētu kaitīgu vai sensitīvu saturu, piemēram, ierobežojumu apiešanu, personu identificējošas informācijas atklāšanu un citus politikas pārkāpumus.

Iekļaujot spriestspēju klasifikācijas procesā, tie nodrošina precīzāku un noturīgāku moderēšanu, ko ir grūtāk apiet. Kā specializēti GPT-OSS 20B un 120B drošības varianti tie nodrošina augstākā līmeņa drošības veiktspēju, bet pielāgotu politiku definīcijas ļauj tos ieviest ar minimālu sagatavošanos.

Ko mēs pārbaudījām

Mēs novērtējām gpt-oss-safeguard 20B un 120B vairākos produkcijas videi pietuvinātos uzdevumos: reāllaika balss asistentā, spēlētāju atbalsta robotā spēlē, proaktīvā tērzēšanas moderēšanas sistēmā un daudzvalodu toksiska satura pārbaudē spāņu, franču, itāļu, portugāļu, krievu un turku valodā.

Ko mēs noskaidrojām

  • Pret latentumu jutīga balss moderēšana: Mūsu reāllaika balss pārbaudēs — iedomājieties klasifikāciju sarunas laikā, kad atbilde nekavējoties jāanalizē un jāšķiro, piemēram, moderējot spēles tērzēšanu, — gpt-oss-safeguard-20B novērsa aptuveni 80% precizitātes starpības starp GPT-OSS-20B un GPT-5-Mini (0,71 pret 0,78, pieaugot no 0,45), vienlaikus darbojoties ar ievērojami mazāku latentumu.

  • Spēlētāju atbalsta eskalācija: Šķirojot spēlētāju atbalsta pieprasījumus, gpt-oss-safeguard-20B novērsa aptuveni 90% rezultātu starpības starp GPT-OSS-20b un GPT-5-Mini (0,66 pret 0,67, pieaugot no 0,57). Tas sasniedza arī labāko makroprecizitāti pārbaudīto modeļu vidū, 88% aptvērumu nekaitīgam saturam un 87% precizitāti neaizsargātu lietotāju noteikšanā — noderīgi, ja vajadzīga piesardzīga un uzticama eskalācija, nepārslogojot moderatorus.

  • Politikas ziņā sarežģītas tērzēšanas moderēšana lielā mērogā: Mūsu visprasīgākajā novērtējumā, kurā moderēšanas sistēmai bija proaktīvi jāatzīmē spēles ziņojumi atbilstoši detalizētam politikas dokumentam, gpt-oss-safeguard pārliecinoši pārspēja OSS bāzes modeli, sasniedzot relatīvu pieaugumu par aptuveni 35% un efektīvi apstrādājot garas politikas. Šis ir īpaši sensitīvs lietojuma scenārijs, kurā vajadzīgs augsts aptvērums un precizitāte. Ja aptvērums būs pārāk zems, daudzi kaitīgi ziņojumi netiks atklāti. Savukārt zema precizitāte nozīmētu, ka moderatoriem tiktu nodoti daudzi neatbilstoši ziņojumi, novēršot viņu uzmanību no patiešām sarežģītajiem gadījumiem.

  • Veiktspēja vairākās valodās: Līdzsvarotā toksiska satura datu kopā sešās valodās gpt-oss-safeguard rezultāti bija tuvi GPT-5-Mini — precizitātes starpība parasti nepārsniedza 3–5 procentpunktus, bet spāņu valodā gpt-oss-safeguard-120B bija nedaudz pārāks. Valodās ar mazāku resursu apjomu, piemēram, turku valodā, novērojām nedaudz lielāku atšķirību, taču kopumā veiktspēja dažādās valodās bija stabila, un, pārejot no 20B uz 120B, aptvērums konsekventi uzlabojās.

Novērojām arī, ka gpt-oss-safeguard modeļi uzrāda labus rezultātus jomās, kurās LVM moderēšanā tradicionāli ir vājāki, piemēram, personu identificējošas informācijas datos. Plaši izmantotie modeļi mēdz labāk atpazīt ASV raksturīgu šāda veida informāciju, bet citos reģionos darbojas vājāk. Tāpēc uzskatām, ka gpt-oss-safeguard palīdzēs vienkāršot moderēšanas sistēmu izveidi, mazinot atkarību no īpaši izstrādātiem rīkiem nelielu politikas pārkāpumu konstatēšanai, ar kuriem vispārīgāki LVM netiek galā.

Mērķētas pielāgošanas iespējas

Tātad mūsu novērtējumi apliecina, ka ar tādiem „moderēšanas pamatmodeļiem” kā gpt-oss-safeguard-20B un gpt-oss-safeguard-120B var ātri sasniegt daudz. Tomēr konkrētai jomai pielāgoti modeļi joprojām nosaka kvalitātes standartu sistēmās ar visaugstākajām drošības un specifiskuma prasībām.

Ekrānuzņēmums, kas ilustrē mērķētas pielāgošanas iespējas.

Spēļu moderēšanas scenārijam mēs ar uzraudzītu pielāgošanu pielāgojām Qwen3-0.6B klasifikatoru, izmantojot aptuveni 10 tūkstošus vēsturisku moderatoru darbību un politikas piemērošanas rezultātu. Šis modelis šajā uzdevumā ievērojami pārspēj visus pārbaudītos bāzes modeļus, sasniedzot 57% precizitāti salīdzinājumā ar 15% (gpt-oss-safeguard-120B; aplēsts pēc GPT-4.1-nano veiktspējas attiecības), proti, par 42 procentpunktiem jeb aptuveni 280% vairāk. Šie rezultāti atbilst OpenAI norādēm, ka mazāki, konkrētam mērķim paredzēti klasifikatori, kas apmācīti ar marķētiem piemēriem, specializētās jomās var pārspēt aizsardzības modeļus.

Secinājums ir skaidrs: ja politika ir niansēta un tajā ir daudz robežgadījumu, neliels konkrētajai jomai pielāgots modelis joprojām ir vislabākā izvēle. Pielāgošanas procesā politika un robežgadījumi tiek tieši iestrādāti modeļa parametros, nodrošinot stabilāku darbību sarežģītajā produkcijas vidē, turklāt ar minimālu latentumu un izmaksām.

Uzraudzīta pielāgošana ir tikai viena no vairākām iespējamām pieejām. Modeļa darbību var optimizēt vēl vairāk, izmantojot arī citas jaudīgas apmācības metodes, piemēram, stimulēto mācīšanos vai destilāciju pēc pašreizējās politikas.

Pielāgošanas ierobežojumi

Pielāgošanai parasti vajag daudz datu. Šī Qwen3-0.6B klasifikatora pielāgošanai izmantoto datu kopu manuāli marķēja moderatori, tāpēc tā bija tīrs un uzticams patiesības avots.

Daudzos projektos sākumā tik vērtīgu datu var nebūt. Tāpēc pielāgošanu parasti uzskatām par optimizācijas posmu, ko var veikt vēlāk risinājuma izstrādes ciklā. Kad risinājums ir stabilizējies un savākti reālu lietotāju dati, izstrādātāji var sākt izmantot mērķētu pielāgošanu, lai moderēšanas risinājumus paceltu nākamajā līmenī.

Noslēguma atziņas

Tādi moderēšanas pamatmodeļi kā gpt-oss-safeguard ir jauni un jaudīgi risinājumu pamatelementi. Tie var būtiski vienkāršot moderēšanas sistēmu izstrādi, vienlaikus samazinot reāllaika lietotņu latentumu. Apvienojot tos ar nelieliem, īpaši izstrādātiem klasifikatoriem, var izveidot drošāku un ātrāku sistēmu ar mazāk komponentiem nekā uz uzvednēm balstītā pieejā ar lieliem vispārīga lietojuma modeļiem.

Ja pašlaik ieviešat vai uzlabojat moderēšanu, vispirms apsveriet tādus modeļus kā gpt-oss-safeguard, izmēriet veiktspēju un vietās, kur dati atklāj trūkumus, ieviesiet mērķētus uzlabojumus ar īpaši izstrādātiem klasifikatoriem — uz uzvednēm balstītiem vai pielāgotiem.

Vai vēlaties uzzināt vairāk? Sazinieties ar mums.

Autors

Douglas Adams, Romain Bourboulou, David Jasek un Atharva Tidke