Navigimi kryesor

Çfarë nënkuptojnë modelet gpt-oss-safeguard të OpenAI për sigurinë e IA-së

Vlerësimi fillestar i modeleve gpt-oss-safeguard të OpenAI tregon ku modelet e specializuara të sigurisë mund të forcojnë sistemet e IA-së në prodhim.

Gjatë dy viteve të fundit kemi krijuar zgjidhje që janë zgjeruar në mënyrë të sigurt për miliona përdorues. Një pjesë thelbësore e kësaj pune ka qenë projektimi i sistemeve të shpejta dhe të sakta të moderimit. Moderimi efektiv u mundëson kompanive të vënë në përdorim me besim zgjidhje të përparuara të IA-së, duke mbrojtur përdoruesit fundorë nga dëmet dhe reputacionin e markës, përmes kapjes së përmbajtjeve të padëshiruara para se të bëhen problem.

Së fundmi, OpenAI publikoi modelet e veta GPT-OSS-Safeguard: versione të përshtatura të modeleve OSS 20B dhe 120B, të prezantuara më herët këtë vit. Këto modele mund ta interpretojnë drejtpërdrejt politikën e përdoruesit gjatë inferencës, duke ofruar një qasje elastike dhe të fuqishme ndaj moderimit të përmbajtjes. Këto modele janë në fazën paraprake kërkimore, ndaj pa dyshim do të vazhdojnë të përmirësohen me kalimin e kohës.

Bashkëpunuam me OpenAI përpara këtij publikimi, duke kryer vlerësime në kushte reale për të ndihmuar zhvillimin e modelit. Në këtë artikull paraqesim njohuritë e nxjerra nga ky bashkëpunim dhe shqyrtojmë se çfarë nënkuptojnë këto përparime për të ardhmen e moderimit në sistemet e IA-së në prodhim.

Si funksionon sot moderimi në prodhim?

Sot, zgjidhjet e moderimit zakonisht ndërtohen si shtresa mbrojtëse rreth aplikacionit. Këtë model projektimi e përdorim shpesh në zbatime publike me volum të lartë. Për një trajtim më të thelluar, mund të lexoni blogun tonë për këtë temë këtu.

  1. Klasifikoni hyrjet paralelisht (mos lejoni kërkesa të dëmshme): Klasifikues të vegjël e të specializuar sipas temës punojnë njëkohësisht për të etiketuar çdo mesazh të përdoruesit. Kemi konstatuar se klasifikuesit me fokus të ngushtë janë dukshëm më të besueshëm se një klasifikues i vetëm për çdo rast. Shembujt e zgjedhur me kujdes, me pak shembuj në kërkesë, mund të ndihmojnë për të dalluar mes «I keep getting killed by this boss» (kontekst loje, krejtësisht i padëmshëm) dhe një sinjali për dëm në botën reale.

    • E sigurt → Gjeneroni normalisht

    • Heqje të kufizimeve mbrojtëse → Shpërfillini ose shmangini me një refuzim në stilin e markës

    • Rreziqe për sigurinë ose mirëqenien → Kalojani një personi, së bashku me kontekst të plotë

  2. Klasifikoni daljet (mos dërgoni përgjigje të dëmshme): Çdo përgjigje e mundshme kontrollohet përsëri para se të dërgohet. Kjo mbron nga devijimi i modelit, helmimi i të dhënave RAG dhe rastet e ndërlikuara të politikave, si përmbajtja e dëmshme, ekspozimi i të dhënave identifikuese personale ose rrjedhja e informacionit sensitiv. Nëse sinjalizohet, përgjigjen e gjeneruar nga LLM-ja e zëvendësojmë me një mesazh të sigurt dhe në përputhje me markën ose ia kalojmë një personi, në vend që të dërgojmë diçka për të cilën do të pendoheshim.

  3. Bëjeni të shpejtë dhe ekonomik: Ndërtimi i kërkesave si komponentë të ripërdorshëm ju lejon të ruani në memorien e përkohshme fragmente kërkesash, shembuj me pak shembuj për klasifikuesit dhe parashtesa të zakonshme dialogu. Kjo qasje ul si vonesën, ashtu edhe koston e masave tuaja mbrojtëse.

  4. Trajtojeni sigurinë si pjesë të produktitRefuzimet dhe paralajmërimet shkruhen me tonin e markës, p.sh. me humor për lojërat dhe formalisht për financat. Kur përvoja e përdoruesit respekton synimin e tij, rritet pranimi i masave mbrojtëse dhe pakësohen përpjekjet për heqjen e kufizimeve mbrojtëse.

  5. Monitoroni, simuloni sulme dhe përmbyllni ciklinSimulimi i vazhdueshëm i sulmeve dhe panelet e drejtpërdrejta të sigurisë ndihmojnë të kapen përkeqësimet para se të prekin përdoruesit. Mund t’ia mësojmë modelit çdo model të ri sulmi duke shtuar shembuj me pak shembuj dhe/ose rregulla drejtimi, në mënyrë që sistemi të bëhet gjithnjë e më i vështirë për t’u cenuar pa dëmtuar performancën e aplikacionit.

Sfidat e ndërtimit të një zgjidhjeje moderimi sot

Ndërtimi dhe mirëmbajtja e masave mbrojtëse efektive është e vështirë.

Në praktikë, kjo kërkon bashkëpunim të kujdesshëm mes palëve kryesore të interesit në biznes dhe zhvilluesve, për të hartuar një politikë të përcaktuar qartë. Pasi politika të jetë përcaktuar, duhen ndërtuar dhe përshtatur arkitektura dhe sjellja e sistemit.

Shfaqja e modeleve të hapura të arsyetimit për sigurinë, si gpt-oss-safeguard, mund të zgjidhë disa nga vështirësitë e këtij procesi, duke ofruar një bazë më të gjithanshme dhe më të gatshme për përdorim në moderimin e përmbajtjes.

Premtimi i modeleve të specializuara të sigurisë

Gpt-oss-safeguard synon të trajtojë disa nga sfidat e zakonshme në ndërtimin e sistemeve të sotme të moderimit. Këto modele të vogla e të specializuara përshtaten për të arsyetuar mbi një politikë të synuar gjatë inferencës, duke kërkuar përmbajtje të dëmshme ose sensitive, si heqje të kufizimeve mbrojtëse, ekspozim të të dhënave identifikuese personale dhe shkelje të tjera të politikave.

Duke përfshirë arsyetimin në procesin e klasifikimit, ato ofrojnë moderim më të saktë e më të qëndrueshëm, i cili është më i vështirë për t’u anashkaluar. Si variante të specializuara sigurie të GPT-OSS 20B dhe 120B, ato mundësojnë performancë të sigurisë në nivelin më të lartë, ndërsa kërkojnë konfigurim minimal përmes përcaktimeve të personalizuara të politikave.

Çfarë testuam

Vlerësuam gpt-oss-safeguard 20B dhe 120B në disa detyra të ngjashme me prodhimin: një asistent zanor në kohë reale, një robot për mbështetjen e lojtarëve brenda lojës, një sistem proaktiv të moderimit të bisedave dhe një kontroll shumëgjuhësh të toksicitetit (spanjisht, frëngjisht, italisht, portugalisht, rusisht dhe turqisht).

Çfarë zbuluam

  • Moderimi zanor ku vonesa është kritike: Në testet tona zanore në kohë reale—pra klasifikim i drejtpërdrejtë brenda një bisede, ku përgjigjja duhet analizuar dhe kategorizuar, si në moderimin e bisedave gjatë lojës—gpt-oss-safeguard-20B ngushtoi rreth 80% të hendekut të saktësisë mes GPT-OSS-20B dhe GPT-5-Mini (0,71 kundrejt 0,78, nga 0,45), me vonesë shumë më të ulët.

  • Kalimi i rasteve të mbështetjes së lojtarëve: Në kategorizimin e mbështetjes së lojtarëve, gpt-oss-safeguard-20B ngushtoi rreth 90% të hendekut nga GPT-OSS-20b te GPT-5-Mini (0,66 kundrejt 0,67, nga 0,57). Ai arriti gjithashtu saktësinë makro më të mirë në grup, 88% rikthim për përmbajtjen e padëmshme dhe 87% precizion në zbulimin e përdoruesve vulnerabël—e dobishme për përshkallëzime konservatore e shumë të besueshme, pa mbingarkuar shqyrtuesit njerëzorë.

  • Moderim në shkallë të gjerë i bisedave me politika të dendura: Në vlerësimin tonë më kërkues, ku sistemi i moderimit duhet të sinjalizojë paraprakisht mesazhet brenda lojës sipas një dokumenti të hollësishëm politikash, gpt-oss-safeguard e tejkaloi dukshëm bazën OSS, me rreth 35% përmirësim relativ, dhe i trajtoi me efektivitet politikat e gjata. Ky është një rast përdorimi veçanërisht sensitiv, që kërkon rikthim dhe precizion të lartë. Nëse rikthimi është shumë i ulët, shumë mesazhe të dëmshme nuk do të zbulohen. Ndërsa precizioni i ulët do të bënte që shumë mesazhe të parëndësishme t’u sinjalizoheshin moderatorëve njerëzorë, duke ua larguar vëmendjen nga rastet vërtet të vështira.

  • Performanca shumëgjuhëshe: Në një grup të balancuar të dhënash për toksicitetin në gjashtë gjuhë, gpt-oss-safeguard pati rezultate të përafërta me GPT-5-Mini, zakonisht brenda 3–5 pikë përqindjeje në saktësi, ndërsa gpt-oss-safeguard-120B doli pak përpara në spanjisht. Vërejtëm dallime pak më të mëdha në gjuhët me më pak burime, si turqishtja, por në përgjithësi performanca ndërgjuhëshe ishte e qëndrueshme, me përmirësime të vazhdueshme të rikthimit gjatë kalimit nga 20B në 120B.

Vërejtëm gjithashtu se modelet gpt-oss-safeguard performojnë mirë në fusha ku LLM-të tradicionalisht janë më të dobëta në moderim, si të dhënat identifikuese personale. Modelet e zakonshme priren të identifikojnë më mirë të dhënat e këtij lloji sipas standardeve amerikane dhe kanë performancë më të dobët në rajone të tjera. Prandaj besojmë se gpt-oss-safeguard do të ndihmojë në thjeshtimin e konfigurimeve të moderimit, duke ulur varësinë nga mjetet e personalizuara për zbulimin e shkeljeve të vogla të politikave që LLM-të më të përgjithshme nuk mund t’i trajtojnë.

Fuqia e përshtatjes së synuar

Pra, vlerësimet tona kanë treguar se «modelet bazë të moderimit», si gpt-oss-safeguard-20B dhe gpt-oss-safeguard-120B, ju çojnë shpejt dhe larg. Megjithatë, përshtatjet për fusha specifike mbeten standardi më i lartë kur sistemet kërkojnë siguri dhe saktësi maksimale.

Pamje ekrani që ilustron fuqinë e përshtatjes së synuar.

Për moderimin brenda lojës, përshtatëm një klasifikues Qwen3-0.6B përmes rregullimit të hollësishëm të mbikëqyrur, duke përdorur rreth 10 mijë veprime historike të moderatorëve dhe rezultate të zbatimit të politikave. Ky model tejkalon ndjeshëm çdo model bazë që testuam për këtë detyrë, me saktësi 57% kundrejt 15% (gpt-oss-safeguard-120B, e përllogaritur nga raporti i performancës së GPT-4.1-nano), pra +42 pikë ose rreth 280% përmirësim. Këto rezultate përputhen me udhëzimin e OpenAI se klasifikuesit më të vegjël e të dedikuar, të trajnuar me shembuj të etiketuar, mund t’i tejkalojnë modelet mbrojtëse në fusha të specializuara.

Përfundimi është i qartë: kur politikat janë të ndërlikuara dhe kanë shumë raste të veçanta, një model i vogël i përshtatur për fushën mbetet standardi i artë. Përshtatja i integron politikën dhe rastet e veçanta drejtpërdrejt në parametrat e modelit, duke siguruar sjellje më të qëndrueshme në mjediset e ndërlikuara të prodhimit, me vonesë dhe kosto minimale.

Rregullimi i hollësishëm i mbikëqyrur është vetëm një nga disa qasje të mundshme. Për të optimizuar më tej sjelljen e modelit, mund të përdoren edhe teknika të tjera të fuqishme trajnimi, si trajnimi përforcues ose distilimi sipas politikës.

Kufizimi i përshtatjes

Përshtatja zakonisht kërkon një sasi të madhe të dhënash. Grupi i të dhënave i përdorur për përshtatjen e këtij klasifikuesi Qwen3-0.6B ishte etiketuar manualisht nga moderatorë njerëzorë, ndaj përbënte një burim të pastër dhe të besueshëm të së vërtetës.

Në shumë projekte, ky avantazh i të dhënave të pasura mund të mungojë në fillim. Prandaj, priremi ta shohim përshtatjen si një optimizim që mund të bëhet më vonë gjatë ciklit të zhvillimit të një zgjidhjeje. Pasi struktura e zgjidhjes të jetë stabilizuar dhe të jenë mbledhur të dhëna reale nga përdoruesit, zhvilluesit mund të përdorin përshtatjen e synuar për t’i çuar zgjidhjet e moderimit në një nivel më të lartë.

Mendime përmbyllëse

Modelet bazë të moderimit, si gpt-oss-safeguard, janë komponentë të rinj dhe të fuqishëm. Ato mund ta thjeshtojnë ndjeshëm projektimin e sistemeve të moderimit, duke ulur njëkohësisht vonesën për aplikacionet në kohë reale. Duke i kombinuar me klasifikues të vegjël e të personalizuar, mund të ndërtoni një sistem më të sigurt dhe më të shpejtë, me më pak pjesë përbërëse sesa një qasje e bazuar në kërkesa me modele të mëdha të përgjithshme.

Nëse po ngrini ose përmirësoni një sistem moderimi sot, merrni parasysh të nisni me modele si gpt-oss-safeguard, të matni performancën dhe të shtoni përmirësime të synuara me klasifikues të personalizuar—të bazuar në kërkesa ose të përshtatur—aty ku të dhënat tregojnë mangësi.

Dëshironi të mësoni më shumë? Na dërgoni një mesazh.

Autor

Douglas Adams, Romain Bourboulou, David Jasek dhe Atharva Tidke