Glavna navigacija

Šta OpenAI modeli gpt-oss-safeguard znače za sigurnost umjetne inteligencije

Rana evaluacija OpenAI modela gpt-oss-safeguard pokazuje gdje specijalizirani sigurnosni modeli mogu ojačati produkcijske AI sisteme.

Tokom protekle dvije godine izgradili smo rješenja koja su sigurno proširena na milione korisnika. Ključni dio tog rada bio je dizajn brzih i preciznih sistema za moderiranje. Efikasno moderiranje omogućava kompanijama da s povjerenjem primjenjuju najsavremenija AI rješenja, štiteći krajnje korisnike od štete i ugled brenda tako što neželjeni generirani sadržaj otkrivaju prije nego što postane problem.

Nedavno je OpenAI objavio svoje modele GPT-OSS-Safeguard: fino podešene verzije OSS modela 20B i 120B predstavljenih ranije ove godine. Ovi modeli mogu direktno tumačiti korisnička pravila tokom izvođenja, pružajući fleksibilan i moćan pristup moderiranju sadržaja. Ovi modeli dostupni su u istraživačkoj pretpremijeri, pa će se s vremenom nesumnjivo nastaviti poboljšavati.

Uoči ove objave sarađivali smo s kompanijom OpenAI i proveli evaluacije u stvarnim uslovima kako bismo doprinijeli razvoju modela. U ovom članku dijelimo saznanja iz te saradnje i istražujemo šta ovaj napredak znači za budućnost moderiranja u produkcijskim AI sistemima.

Kako moderiranje danas funkcionira u produkciji?

Rješenja za moderiranje danas se obično oblikuju kao zaštitni slojevi oko aplikacije. Ovaj obrazac često koristimo u javno dostupnim implementacijama s velikim obimom saobraćaja. Za detaljniji pregled pročitajte naš blog o ovoj temi ovdje.

  1. Paralelno klasificirajte ulaze (ne propuštajte štetne upite): Mali klasifikatori za određene teme rade istovremeno i označavaju svaku korisničku poruku. Utvrdili smo da su usko specijalizirani klasifikatori mjerljivo pouzdaniji od jednog univerzalnog klasifikatora. Pažljivo odabrani primjeri za učenje s malim brojem primjera u upitu mogu pomoći da se razlikuju „I keep getting killed by this boss“ (kontekst igre, potpuno bezopasno) i stvarni znakovi opasnosti.

    • Sigurno → Generirajte kao i obično

    • Jailbreakovi → Zanemarite ih ili preusmjerite odgovor odbijanjem u stilu brenda

    • Rizici za sigurnost ili dobrobit → proslijedite osobi uz detaljan kontekst

  2. Klasificirajte izlaze (ne isporučujte loš odgovor): Svaki predloženi odgovor ponovo se provjerava prije isporuke. To štiti od odstupanja modela, trovanja RAG podataka i suptilnih graničnih slučajeva pravila, poput štetnog sadržaja, izlaganja ličnih podataka ili curenja osjetljivih informacija. Ako se odgovor označi, zamjenjujemo odgovor koji je generirao LLM sigurnom porukom usklađenom s brendom ili ga prosljeđujemo osobi, umjesto da isporučimo nešto zbog čega ćemo požaliti.

  3. Osigurajte brzinu i pristupačnost: Izrada upita u obliku višekratno upotrebljivih gradivnih elemenata omogućava keširanje dijelova upita, primjera za učenje s malim brojem primjera za klasifikatore i uobičajenih početaka dijaloga. Ovaj pristup smanjuje i kašnjenje i troškove zaštitnih mehanizama.

  4. Tretirajte sigurnost kao dio proizvodaOdbijanja i upozorenja pišu se u tonu brenda, naprimjer razigrano za igre, a formalno za finansije. Kada korisničko iskustvo uvažava namjeru korisnika, prihvatanje zaštitnih mehanizama raste, a broj pokušaja jailbreaka opada.

  5. Pratite, provodite red teaming i zatvorite povratnu spreguKontinuirani red teaming i nadzorne ploče za sigurnost u stvarnom vremenu pomažu otkriti regresije prije nego što dođu do korisnika. Model možemo upoznati sa svakim novim obrascem napada dodavanjem primjera za učenje s malim brojem primjera i/ili pravila usmjeravanja, tako da sistem s vremenom postaje otporniji bez ugrožavanja performansi aplikacije.

Današnji izazovi pri izradi rješenja za moderiranje

Izgradnja i održavanje efikasnih zaštitnih mehanizama zahtjevan je posao.

U praksi je potrebna pažljiva saradnja ključnih poslovnih aktera i programera kako bi se definirala jasna pravila. Nakon definiranja pravila potrebno je izgraditi i podesiti dizajn sistema i njegovo ponašanje.

Pojava otvorenih sigurnosnih modela za rezonovanje, kao što je gpt-oss-safeguard, mogla bi riješiti neke poteškoće u ovom procesu i pružiti spremniju i svestraniju osnovu za moderiranje sadržaja.

Potencijal specijaliziranih sigurnosnih modela

Gpt-oss-safeguard nastoji riješiti neke od uobičajenih izazova pri izgradnji današnjih sistema za moderiranje. Ovi mali, specijalizirani modeli fino su podešeni da tokom izvođenja rezonuju na osnovu ciljnih pravila i traže štetan ili osjetljiv sadržaj, poput jailbreakova, izlaganja ličnih podataka i drugih kršenja pravila.

Uključivanjem rezonovanja u proces klasifikacije omogućavaju preciznije i otpornije moderiranje koje je teže zaobići. Kao specijalizirane sigurnosne varijante modela GPT-OSS 20B i 120B, omogućavaju vrhunske sigurnosne rezultate uz minimalan napor pri postavljanju zahvaljujući prilagođenim definicijama pravila.

Šta smo testirali

Evaluirali smo gpt-oss-safeguard 20B i 120B na nekoliko zadataka oblikovanih prema produkcijskim uslovima: glasovnom asistentu u stvarnom vremenu, botu za podršku igračima u igri, proaktivnom sistemu za moderiranje razgovora i višejezičnoj provjeri toksičnosti na španskom, francuskom, italijanskom, portugalskom, ruskom i turskom jeziku.

Šta smo otkrili

  • Glasovno moderiranje osjetljivo na kašnjenje: U našim testovima glasa u stvarnom vremenu — zamislite klasifikaciju uživo unutar razgovora, gdje odgovor treba analizirati i odrediti mu prioritet, poput moderiranja razgovora tokom igre — gpt-oss-safeguard-20B smanjio je oko 80% razlike u tačnosti između modela GPT-OSS-20B i GPT-5-Mini (0,71 naspram 0,78, u odnosu na početnih 0,45), uz znatno manje kašnjenje.

  • Eskalacija podrške igračima: Pri određivanju prioriteta podrške igračima, gpt-oss-safeguard-20B smanjio je oko 90% razlike između modela GPT-OSS-20b i GPT-5-Mini (0,66 naspram 0,67, u odnosu na početnih 0,57). Ostvario je i najbolju makropreciznost u skupu, odziv od 88% za bezopasan sadržaj te preciznost od 87% pri otkrivanju ranjivih korisnika — što je korisno ako želite oprezne i pouzdane eskalacije bez preopterećivanja ljudskih provjeravatelja.

  • Moderiranje razgovora prema opsežnim pravilima: U našoj najzahtjevnijoj evaluaciji, gdje sistem za moderiranje mora proaktivno označavati poruke u igri prema opsežnom dokumentu s pravilima, gpt-oss-safeguard jasno je nadmašio osnovni OSS model, ostvarivši relativno poboljšanje od oko 35% i efikasno obrađujući duga pravila. Ovo je naročito osjetljiv slučaj primjene koji zahtijeva visok odziv i preciznost. Ako je odziv prenizak, mnoge štetne poruke neće biti otkrivene. Niska preciznost dovela bi do toga da se mnoge nebitne poruke šalju ljudskim moderatorima, odvraćajući njihovu pažnju od zaista zahtjevnih slučajeva.

  • Višejezične performanse: Na uravnoteženom skupu podataka o toksičnosti na šest jezika, gpt-oss-safeguard ostvario je rezultate slične modelu GPT-5-Mini, obično uz razliku u tačnosti od 3 do 5 procentnih bodova, dok je gpt-oss-safeguard-120B bio neznatno bolji na španskom. Uočili smo nešto veće razlike kod jezika s manje dostupnih resursa, poput turskog, ali ukupni rezultati pokazali su dobre performanse na različitim jezicima, uz dosljedno povećanje odziva pri prelasku s modela 20B na 120B.

Također smo uočili da modeli gpt-oss-safeguard ostvaruju dobre rezultate u područjima u kojima su LLM-ovi tradicionalno slabiji pri moderiranju, poput ličnih podataka. Uobičajeni modeli uglavnom su skloniji prepoznavanju ličnih podataka u američkim formatima, dok slabije rade s podacima iz drugih geografskih područja. Zbog toga vjerujemo da će gpt-oss-safeguard pojednostaviti postavljanje moderiranja smanjenjem oslanjanja na prilagođene alate za otkrivanje manjih kršenja pravila koja širi LLM-ovi ne mogu obraditi.

Moć ciljanog finog podešavanja

Naše evaluacije pokazale su da „temeljni modeli za moderiranje“, kao što su gpt-oss-safeguard-20B i gpt-oss-safeguard-120B, brzo daju dobre rezultate. Međutim, modeli fino podešeni za određenu domenu i dalje postavljaju standard kada sistemi zahtijevaju najviši nivo sigurnosti i specifičnosti.

Snimak ekrana koji prikazuje moć ciljanog finog podešavanja.

Za moderiranje u igri fino smo podesili klasifikator Qwen3-0.6B primjenom finog podešavanja pod nadzorom na oko 10.000 historijskih odluka moderatora i ishoda primjene pravila. Ovaj model je u ovom zadatku znatno nadmašio svaki osnovni model koji smo testirali, ostvarivši tačnost od 57% naspram 15% (gpt-oss-safeguard-120B, procijenjeno prema omjeru rezultata modela GPT-4.1-nano), što je rast od 42 procentna boda, odnosno oko 280%. Ovi rezultati u skladu su sa smjernicama kompanije OpenAI da manji, namjenski klasifikatori obučeni na označenim primjerima mogu nadmašiti zaštitne modele u specijaliziranim domenama.

Zaključak je jasan: kada su pravila nijansirana i imaju mnogo graničnih slučajeva, mali model prilagođen domeni ostaje zlatni standard. Finim podešavanjem pravila i granični slučajevi ugrađuju se direktno u parametre, što osigurava stabilnije ponašanje u neurednom produkcijskom okruženju, uz minimalno kašnjenje i troškove.

Fino podešavanje pod nadzorom samo je jedan od nekoliko mogućih pristupa. Za dodatnu optimizaciju ponašanja modela mogu se primijeniti i druge moćne tehnike obuke, poput učenja s potkrepljivanjem ili destilacije na osnovu vlastite politike.

Ograničenje finog podešavanja

Fino podešavanje obično zahtijeva mnogo podataka. Skup podataka korišten za fino podešavanje ovog klasifikatora Qwen3-0.6B ručno su označili moderatori, pa je predstavljao čist i pouzdan izvor tačnih podataka.

U mnogim projektima takva prednost bogatih podataka ne postoji na samom početku. Zato fino podešavanje obično smatramo optimizacijom koja se može primijeniti kasnije u razvojnom ciklusu rješenja. Kada se struktura rješenja stabilizira i prikupe stvarni korisnički podaci, programeri mogu razmotriti ciljano fino podešavanje kako bi dodatno unaprijedili svoja rješenja za moderiranje.

Završna razmatranja

Temeljni modeli za moderiranje poput gpt-oss-safeguard predstavljaju moćne nove gradivne elemente. Mogu znatno pojednostaviti dizajn sistema za moderiranje i istovremeno smanjiti kašnjenje u aplikacijama koje rade u stvarnom vremenu. Kombinirajte ih s malim, prilagođenim klasifikatorima i možete izgraditi sigurniji i brži sistem s manje pokretnih dijelova nego kod pristupa zasnovanog na upitima i velikim modelima opće namjene.

Ako danas uvodite ili nadograđujete moderiranje, razmotrite da prvo primijenite modele poput gpt-oss-safeguard, izmjerite rezultate te uvedete ciljana poboljšanja pomoću prilagođenih klasifikatora, zasnovanih na upitima ili fino podešenih, tamo gdje podaci otkriju nedostatke.

Želite saznati više? Pošaljite nam poruku.

Autor

Douglas Adams, Romain Bourboulou, David Jasek i Atharva Tidke