V zadnjih dveh letih smo ustvarili rešitve, ki so se varno razširile na milijone uporabnikov. Ključni del tega dela je bilo načrtovanje hitrih in natančnih sistemov za moderiranje. Učinkovito moderiranje podjetjem omogoča samozavestno uvajanje najsodobnejših rešitev umetne inteligence, saj končne uporabnike varuje pred škodo in ščiti ugled blagovne znamke tako, da neželene rezultate prestreže, preden postanejo težava.
Pred kratkim je OpenAI izdal svoje modele GPT-OSS-Safeguard: dodatno prilagojene različice modelov OSS 20B in 120B, predstavljenih v začetku tega leta. Ti modeli lahko uporabnikov pravilnik razlagajo neposredno med izvajanjem, kar omogoča prilagodljiv in zmogljiv pristop k moderiranju vsebine. Modeli so na voljo kot raziskovalni predogled, zato se bodo sčasoma nedvomno še izboljševali.
Pred izdajo smo sodelovali z OpenAI in izvajali vrednotenja v resničnem okolju, ki so pomagala usmerjati razvoj modelov. V tem članku predstavljamo spoznanja iz tega sodelovanja in raziskujemo, kaj ta napredek pomeni za prihodnost moderiranja v produkcijskih sistemih umetne inteligence.
Danes so rešitve za moderiranje običajno zasnovane kot več zaščitnih plasti okoli aplikacije. Ta vzorec pogosto uporabljamo pri javno dostopnih uvedbah z velikim obsegom uporabe. Za podrobnejšo razlago si lahko tukaj preberete naš prispevek na to temo.
Vzporedno razvrščajte vhode (ne dovolite vstopa škodljivim pozivom): Majhni klasifikatorji za posamezne teme sočasno označijo vsako uporabniško sporočilo. Ugotovili smo, da so ozko usmerjeni klasifikatorji merljivo zanesljivejši od enega samega klasifikatorja za vse namene. Skrbno izbrani primeri za učenje iz malo primerov v pozivu lahko pomagajo razlikovati med »I keep getting killed by this boss« (kontekst igre, povsem neškodljivo) in znakom nevarnosti v resničnem svetu.
Varno → Ustvari kot običajno
Prebijanje varnostnih mehanizmov → Prezri ali preusmeri z zavrnitvijo v slogu blagovne znamke
Tveganja za varnost ali dobrobit → Predaj človeku z izčrpnim kontekstom
Razvrščajte izhode (ne pošljite slabega odgovora): Vsak predlagani odgovor se pred dostavo znova preveri. To ščiti pred odmikom modela, zastrupljanjem podatkov RAG in prefinjenimi mejnimi primeri pravilnikov, kot so škodljiva vsebina, razkritje osebnih podatkov ali uhajanje občutljivih informacij. Če sistem odgovor označi, odgovor, ki ga je ustvaril veliki jezikovni model, nadomestimo z varnim sporočilom, skladnim z blagovno znamko, ali pa ga predamo človeku, namesto da bi poslali nekaj, kar bi pozneje obžalovali.
Poskrbite za hitrost in dostopno ceno: Če pozive sestavite kot gradnike za večkratno uporabo, lahko predpomnite njihove dele, primere za učenje iz malo primerov za klasifikatorje in pogoste začetke pogovorov. S tem pristopom lahko zmanjšate zakasnitev in stroške zaščitnih mehanizmov.
Varnost obravnavajte kot del uporabniške izkušnjeZavrnitve in opozorila naj bodo napisana v ustreznem slogu (npr. igrivo za igre in formalno za finance). Ko uporabniška izkušnja upošteva namen uporabnika, se sprejemanje zaščitnih mehanizmov poveča, poskusi prebijanja varnostnih mehanizmov pa zmanjšajo.
Spremljajte, izvajajte simulirano iskanje šibkih točk v nadzorovanem okolju in sklenite povratno zankoNenehno simulirano iskanje šibkih točk v nadzorovanem okolju in nadzorne plošče za varnost v živo pomagajo odkriti poslabšanja, preden prizadenejo uporabnike. Model lahko naučimo prepoznavati nove vzorce napadov z dodatnimi primeri za učenje iz malo primerov in/ali pravili usmerjanja. Tako sistem sčasoma postaja odpornejši, ne da bi se zmanjšala zmogljivost aplikacije.
Ustvarjanje in vzdrževanje učinkovitih zaščitnih mehanizmov je zahtevno.
V praksi dobro opredeljen pravilnik zahteva tesno sodelovanje med ključnimi poslovnimi deležniki in razvijalci. Ko je pravilnik opredeljen, je treba zasnovati sistem ter vzpostaviti in prilagoditi njegovo delovanje.
Pojav odprtih varnostnih modelov s sklepanjem, kot je gpt-oss-safeguard, lahko odpravi nekatere težave v tem procesu ter zagotovi bolj vsestransko in za uporabo pripravljeno osnovo za moderiranje vsebine.
Gpt-oss-safeguard želi odpraviti nekatere pogoste izzive pri razvoju današnjih sistemov za moderiranje. Ti majhni specializirani modeli so dodatno prilagojeni za sklepanje na podlagi ciljnega pravilnika med izvajanjem ter iščejo škodljivo ali občutljivo vsebino, kot so prebijanje varnostnih mehanizmov, razkritje osebnih podatkov in druge kršitve pravilnika.
Z vključevanjem sklepanja v postopek razvrščanja omogočajo natančnejše in odpornejše moderiranje, ki ga je težje zaobiti. Kot specializirane varnostne različice modelov GPT-OSS 20B in 120B omogočajo najsodobnejšo raven varnosti, pri čemer je zaradi prilagojenih opredelitev pravilnikov potrebnega zelo malo začetnega dela.
Modela gpt-oss-safeguard 20B in 120B smo ovrednotili pri več nalogah, oblikovanih po produkcijskih primerih: glasovnem pomočniku v realnem času, botu za podporo igralcem v igri, proaktivnem sistemu za moderiranje klepeta in večjezičnem preverjanju strupene vsebine (v španščini, francoščini, italijanščini, portugalščini, ruščini in turščini).
Glasovno moderiranje, občutljivo na zakasnitev: V naših preizkusih glasu v realnem času (predstavljajte si sprotno razvrščanje v pogovoru, kjer je treba odgovor analizirati in določiti njegovo prednost, denimo pri moderiranju klepeta med igranjem) je gpt-oss-safeguard-20B odpravil približno 80 % razlike v natančnosti med GPT-OSS-20B in GPT-5-Mini (0,71 proti 0,78, prej 0,45), pri tem pa deloval z bistveno manjšo zakasnitvijo.
Predaja podpore igralcem: Pri razvrščanju zahtev za podporo igralcem je gpt-oss-safeguard-20B odpravil približno 90 % razlike med GPT-OSS-20b in GPT-5-Mini (0,66 proti 0,67, prej 0,57). Dosegel je tudi najboljšo makropreciznost med preizkušenimi modeli, 88-odstotni priklic neškodljive vsebine in 87-odstotno preciznost pri odkrivanju ranljivih uporabnikov. To je koristno za previdne in zelo zanesljive predaje, ki človeških pregledovalcev ne preobremenijo.
Obsežno moderiranje klepeta z obsežnimi pravilniki: Pri našem najzahtevnejšem vrednotenju, kjer mora sistem za moderiranje proaktivno označevati sporočila v igri na podlagi obsežnega pravilnika, je gpt-oss-safeguard jasno prekašal osnovni model OSS, dosegel približno 35-odstotno relativno izboljšanje in učinkovito obdelal dolge pravilnike. To je posebej občutljiv primer uporabe, ki zahteva visok priklic in visoko preciznost. Če je priklic prenizek, sistem spregleda veliko škodljivih sporočil. Nizka preciznost pa pomeni, da sistem človeškim moderatorjem v pregled pošlje veliko nepomembnih sporočil in njihovo pozornost preusmeri od resnično zahtevnih primerov.
Večjezična zmogljivost: Na uravnoteženi podatkovni množici strupene vsebine v šestih jezikih je gpt-oss-safeguard dosegal rezultate blizu GPT-5-Mini, pri natančnosti običajno znotraj 3–5 odstotnih točk, gpt-oss-safeguard-120B pa je bil nekoliko boljši v španščini. Nekoliko večje razlike smo opazili pri jezikih z manj viri, kot je turščina, vendar je splošni vzorec pokazal zanesljivo medjezično zmogljivost in dosledno izboljšanje priklica pri prehodu z 20B na 120B.
Opazili smo tudi, da so modeli gpt-oss-safeguard zelo uspešni na področjih, kjer so veliki jezikovni modeli pri moderiranju tradicionalno šibkejši, na primer pri osebnih podatkih. Splošni modeli so namreč bolj nagnjeni k prepoznavanju osebnih podatkov v ameriških oblikah, v drugih geografskih okoljih pa so manj uspešni. Zato menimo, da bo gpt-oss-safeguard poenostavil vzpostavitev moderiranja, saj bo zmanjšal odvisnost od namensko izdelanih orodij za odkrivanje manjših kršitev pravilnikov, ki jim splošnejši veliki jezikovni modeli niso kos.
Naša vrednotenja so torej pokazala, da lahko s »temeljnimi modeli za moderiranje«, kot sta gpt-oss-safeguard-20B in gpt-oss-safeguard-120B, hitro dosežete veliko. Kadar pa sistemi zahtevajo najvišjo raven varnosti in specifičnosti, merilo še vedno postavljajo modeli, dodatno prilagojeni posameznemu področju.


Za moderiranje znotraj igre smo klasifikator Qwen3-0.6B z nadzorovanim dodatnim prilagajanjem učili na približno 10.000 preteklih ukrepih moderatorjev in odločitvah na podlagi pravilnikov. Ta model pri tej nalogi z veliko prednostjo prekaša vse preizkušene osnovne modele: dosega 57-odstotno natančnost v primerjavi s 15 odstotki (gpt-oss-safeguard-120B, ocenjeno iz razmerja glede na zmogljivost GPT-4.1-nano), kar pomeni 42 odstotnih točk oziroma približno 280-odstotno izboljšanje. Ti rezultati so skladni s smernicami OpenAI, po katerih lahko manjši namenski klasifikatorji, učeni na označenih primerih, na specializiranih področjih prekašajo varnostne modele.
Sklep je jasen: kadar so pravilniki večplastni in vključujejo veliko mejnih primerov, ostaja najboljša izbira majhen model, prilagojen posameznemu področju. Z dodatnim prilagajanjem se pravilnik in mejni primeri vgradijo neposredno v parametre, kar zagotavlja stabilnejše delovanje v neurejenem produkcijskem okolju ob zelo majhni zakasnitvi in nizkih stroških.
Nadzorovano dodatno prilagajanje je le eden od več možnih pristopov. Delovanje modela je mogoče dodatno optimizirati tudi z drugimi zmogljivimi tehnikami učenja, kot sta okrepljeno učenje in destilacija na podlagi lastnih odločitev.
Dodatno prilagajanje običajno zahteva veliko podatkov. Podatkovno množico za dodatno prilagajanje tega klasifikatorja Qwen3-0.6B so ročno označili človeški moderatorji, zato je bila čist in zanesljiv referenčni vir.
Pri številnih projektih tako bogati podatki na začetku niso na voljo. Zato dodatno prilagajanje običajno obravnavamo kot optimizacijo, ki pride na vrsto pozneje v razvojnem ciklu rešitve. Ko se zasnova rešitve ustali in je zbranih nekaj dejanskih uporabniških podatkov, lahko razvijalci s ciljno usmerjenim dodatnim prilagajanjem svoje rešitve za moderiranje dvignejo na višjo raven.
Temeljni modeli za moderiranje, kot je gpt-oss-safeguard, so zmogljivi novi gradniki. Občutno lahko poenostavijo zasnovo sistemov za moderiranje in hkrati zmanjšajo zakasnitev pri aplikacijah v realnem času. Če jih združite z majhnimi namensko izdelanimi klasifikatorji, lahko ustvarite varnejši in hitrejši sistem z manj sestavnimi deli kot pri pristopu, ki temelji na pozivih za velike splošne modele.
Če danes vzpostavljate ali nadgrajujete moderiranje, najprej razmislite o modelih, kot je gpt-oss-safeguard. Izmerite njihovo zmogljivost in tam, kjer podatki pokažejo vrzeli, uvedite ciljne izboljšave z namensko izdelanimi klasifikatorji, ki temeljijo na pozivih ali dodatnem prilagajanju.
Želite izvedeti več? Pošljite nam sporočilo.