Tijekom protekle dvije godine izgradili smo rješenja koja su se sigurno proširila na milijune korisnika. Ključan dio tog rada bio je razvoj brzih i preciznih sustava za moderiranje. Učinkovito moderiranje omogućuje tvrtkama da pouzdano uvedu najnaprednija AI rješenja, zaštite krajnje korisnike od štete i očuvaju sigurnost robne marke otkrivanjem neželjenih generiranih sadržaja prije nego što postanu problem.
OpenAI je nedavno objavio svoje modele GPT-OSS-Safeguard: precizno podešene inačice modela OSS 20B i 120B predstavljenih ranije ove godine. Ti modeli mogu izravno tumačiti korisnikova pravila tijekom zaključivanja, pružajući fleksibilan i učinkovit pristup moderiranju sadržaja. Ti su modeli dostupni u istraživačkoj pretpreglednoj verziji pa će se s vremenom nedvojbeno nastaviti poboljšavati.
Prije ove objave surađivali smo s tvrtkom OpenAI i provodili evaluacije u stvarnim uvjetima kako bismo pridonijeli razvoju modela. U ovom članku iznosimo spoznaje iz te suradnje i istražujemo što taj napredak znači za budućnost moderiranja u produkcijskim AI sustavima.
Rješenja za moderiranje danas obično imaju oblik zaštitnih slojeva koji okružuju aplikaciju. Taj obrazac često primjenjujemo u javno dostupnim sustavima s velikim opterećenjem. Za detaljniji pregled pročitajte naš blog o toj temi ovdje.
Paralelno klasificirajte ulaze (ne propuštajte loše upite): Mali klasifikatori specijalizirani za određene teme istodobno označavaju svaku korisničku poruku. Utvrdili smo da su usko specijalizirani klasifikatori mjerljivo pouzdaniji od jednog univerzalnog klasifikatora. Pomno odabrani primjeri za učenje s malim brojem primjera u upitu mogu pomoći razlikovati „I keep getting killed by this boss” (kontekst igre, potpuno bezopasno) od signala stvarne opasnosti.
Sigurno → generiraj uobičajeno
Jailbreakovi → zanemari ili preusmjeri odbijanjem usklađenim s robnom markom
Rizici za sigurnost ili dobrobit → proslijedi osobi uz opsežan kontekst
Klasificirajte izlaze (ne šaljite loš odgovor): Svaki mogući odgovor ponovno se provjerava prije isporuke. To štiti od odstupanja modela, trovanja RAG podataka i suptilnih rubnih slučajeva pravila, kao što su štetan sadržaj, izlaganje osobnih podataka ili curenje osjetljivih informacija. Ako je odgovor označen, zamjenjujemo odgovor koji je generirao LLM sigurnom porukom usklađenom s robnom markom ili ga prosljeđujemo osobi, umjesto da pošaljemo nešto zbog čega ćemo požaliti.
Osigurajte brzinu i pristupačnost: Izrada upita u obliku višekratno upotrebljivih gradivnih elemenata omogućuje predmemoriranje dijelova upita, primjera za učenje s malim brojem primjera za klasifikatore i uobičajenih početaka dijaloga. Tim pristupom možete smanjiti i latenciju i troškove zaštitnih mehanizama.
Postupajte sa sigurnošću kao s dijelom proizvodaOdbijanja i upozorenja pišu se u tonu proizvoda, primjerice razigrano za igre, a formalno za financije. Kada korisničko iskustvo poštuje korisnikovu namjeru, raste prihvaćanje zaštitnih mehanizama, a pokušaji jailbreaka se smanjuju.
Pratite, provodite red-team testiranje i zatvorite povratnu petljuKontinuirano red-team testiranje i nadzorne ploče za sigurnost uživo pomažu otkriti regresije prije nego što utječu na korisnike. Model možemo podučiti novim obrascima napada dodavanjem primjera za učenje s malim brojem primjera i/ili pravila usmjeravanja, tako da sustav s vremenom postaje otporniji bez narušavanja performansi aplikacije.
Izgradnja i održavanje učinkovitih zaštitnih mehanizama zahtjevni su.
U praksi je potrebna bliska suradnja ključnih poslovnih dionika i razvojnih programera kako bi se izradila jasno definirana pravila. Nakon definiranja pravila potrebno je izgraditi i prilagoditi dizajn i ponašanje sustava.
Pojava otvorenih sigurnosnih modela za rasuđivanje, kao što je gpt-oss-safeguard, mogla bi ukloniti neke poteškoće u tom procesu i pružiti svestraniju osnovu za moderiranje sadržaja, spremnu za upotrebu.
Gpt-oss-safeguard nastoji riješiti neke od uobičajenih izazova pri izradi današnjih sustava za moderiranje. Ti mali, specijalizirani modeli precizno su podešeni za rasuđivanje o ciljanim pravilima tijekom zaključivanja te traže štetan ili osjetljiv sadržaj, poput jailbreakova, izlaganja osobnih podataka i drugih kršenja pravila.
Uključivanjem rasuđivanja u postupak klasifikacije omogućuju preciznije i otpornije moderiranje koje je teže zaobići. Kao specijalizirane sigurnosne inačice modela GPT-OSS 20B i 120B omogućuju vrhunske sigurnosne rezultate uz minimalan napor pri postavljanju zahvaljujući prilagođenim definicijama pravila.
Evaluirali smo gpt-oss-safeguard 20B i 120B na nekoliko zadataka oblikovanih prema produkcijskim uvjetima: glasovnom asistentu u stvarnom vremenu, botu za podršku igračima unutar igre, sustavu za proaktivno moderiranje razgovora i višejezičnoj provjeri toksičnosti na španjolskom, francuskom, talijanskom, portugalskom, ruskom i turskom jeziku.
Glasovno moderiranje osjetljivo na latenciju: U našim glasovnim testovima u stvarnom vremenu — odnosno pri klasifikaciji uživo unutar razgovora u kojem odgovor treba analizirati i razvrstati, kao kod moderiranja razgovora tijekom igre — gpt-oss-safeguard-20B smanjio je približno 80 % razlike u točnosti između modela GPT-OSS-20B i GPT-5-Mini (0,71 prema 0,78, u odnosu na početnih 0,45), uz znatno manju latenciju.
Eskalacija podrške igračima: Pri razvrstavanju zahtjeva za podršku igračima gpt-oss-safeguard-20B smanjio je približno 90 % razlike između modela GPT-OSS-20b i GPT-5-Mini (0,66 prema 0,67, u odnosu na početnih 0,57). Postigao je i najbolju makropreciznost među testiranim modelima, odziv od 88 % za bezopasan sadržaj te preciznost od 87 % u otkrivanju ranjivih korisnika, što je korisno za oprezne i pouzdane eskalacije bez preopterećivanja ljudskih pregledavatelja.
Opsežno moderiranje razgovora prema složenim pravilima: U našoj najzahtjevnijoj evaluaciji, u kojoj sustav za moderiranje mora proaktivno označavati poruke unutar igre prema opsežnom dokumentu s pravilima, gpt-oss-safeguard jasno je nadmašio osnovni OSS model, ostvarivši relativno poboljšanje od približno 35 % i učinkovito obrađujući duga pravila. Riječ je o posebno osjetljivom slučaju primjene koji zahtijeva visok odziv i preciznost. Ako je odziv prenizak, mnoge će štetne poruke ostati neotkrivene. Niska preciznost dovela bi do označavanja mnogih nevažnih poruka za ljudske moderatore, odvlačeći im pozornost od doista zahtjevnih slučajeva.
Višejezične performanse: Na uravnoteženom skupu podataka o toksičnosti na šest jezika gpt-oss-safeguard postizao je rezultate bliske modelu GPT-5-Mini, obično unutar 3 – 5 postotnih bodova točnosti, dok je gpt-oss-safeguard-120B bio neznatno bolji na španjolskom. Uočili smo nešto veće razlike u jezicima s manje dostupnih resursa, poput turskog, no opći obrazac pokazao je dobre rezultate među jezicima i dosljedno povećanje odziva pri prelasku s modela 20B na 120B.
Uočili smo i da modeli gpt-oss-safeguard postižu dobre rezultate u područjima u kojima su LLM-ovi tradicionalno slabiji u moderiranju, primjerice kod osobnih podataka. Uobičajeni modeli skloniji su prepoznavanju oblika osobnih podataka tipičnih za SAD, a slabije rade u drugim geografskim područjima. Stoga vjerujemo da će gpt-oss-safeguard pojednostavniti postavljanje moderiranja smanjenjem ovisnosti o prilagođenim alatima za otkrivanje manjih kršenja pravila s kojima se općenitiji LLM-ovi ne mogu nositi.
Naše su evaluacije pokazale da „temeljni modeli za moderiranje”, kao što su gpt-oss-safeguard-20B i gpt-oss-safeguard-120B, omogućuju brzo postizanje dobrih rezultata. Međutim, precizno podešeni modeli za određenu domenu i dalje postavljaju mjerilo kada sustavi zahtijevaju najviše standarde sigurnosti i specifičnosti.


Za moderiranje unutar igre precizno smo podesili klasifikator Qwen3-0.6B primjenom preciznog podešavanja uz nadzor na približno 10 tisuća povijesnih odluka moderatora i ishoda primjene pravila. Taj model znatno nadmašuje svaki osnovni model koji smo testirali na ovom zadatku: postiže točnost od 57 % u odnosu na 15 % (gpt-oss-safeguard-120B, procjena na temelju omjera rezultata modela GPT-4.1-nano), odnosno poboljšanje od 42 postotna boda ili približno 280 %. Ti su rezultati u skladu sa smjernicama tvrtke OpenAI prema kojima manji, namjenski klasifikatori obučeni na označenim primjerima mogu nadmašiti zaštitne modele u specijaliziranim domenama.
Zaključak je jasan: kada su pravila nijansirana i imaju mnogo rubnih slučajeva, mali model prilagođen domeni i dalje je zlatni standard. Proces preciznog podešavanja ugrađuje vaša pravila i rubne slučajeve izravno u parametre, čime se postiže stabilnije ponašanje u neurednim produkcijskim uvjetima, uz vrlo malu latenciju i troškove.
Precizno podešavanje uz nadzor samo je jedan od nekoliko mogućih pristupa. Za dodatnu optimizaciju ponašanja modela mogu se primijeniti i druge napredne tehnike obuke, kao što su učenje s potkrepljivanjem ili destilacija na temelju trenutačne politike.
Precizno podešavanje obično zahtijeva mnogo podataka. Skup podataka za precizno podešavanje ovog klasifikatora Qwen3-0.6B ručno su označili ljudski moderatori, pa je predstavljao čist i pouzdan izvor istine.
U mnogim projektima takva prednost bogatih podataka možda ne postoji na početku. Zato precizno podešavanje obično smatramo optimizacijom koja može uslijediti kasnije u razvojnom ciklusu rješenja. Nakon što se struktura rješenja stabilizira i prikupe stvarni korisnički podaci, razvojni programeri mogu ciljanim preciznim podešavanjem dodatno unaprijediti svoja rješenja za moderiranje.
Temeljni modeli za moderiranje poput modela gpt-oss-safeguard snažni su novi gradivni elementi. Mogu znatno pojednostavniti dizajn sustava za moderiranje i istodobno smanjiti latenciju aplikacija koje rade u stvarnom vremenu. Uparite ih s malim, prilagođenim klasifikatorima i možete izgraditi sigurniji i brži sustav s manje pokretnih dijelova nego što ih ima pristup temeljen na upitima i velikim modelima opće namjene.
Ako danas uvodite ili nadograđujete moderiranje, razmislite o tome da prvo primijenite modele poput gpt-oss-safeguard, izmjerite rezultate te uvedete ciljana poboljšanja s pomoću prilagođenih klasifikatora, temeljenih na upitima ili precizno podešenih, ondje gdje podaci pokažu nedostatke.
Želite saznati više? Pošaljite nam poruku.