Matul dawn l-aħħar sentejn, bnejna soluzzjonijiet li kibru b’mod sikur biex jaqdu miljuni ta’ utenti. Parti ewlenija minn dan ix-xogħol kienet it-tfassil ta’ sistemi ta’ moderazzjoni veloċi u preċiżi. Moderazzjoni effettiva tippermetti lill-kumpaniji jħaddmu soluzzjonijiet avvanzati tal-IA b’kunfidenza, filwaqt li jipproteġu lill-utenti finali mill-ħsara u jiżguraw is-sikurezza tal-marka billi jaqbdu ġenerazzjonijiet mhux mixtieqa qabel ma jsiru problema.
Dan l-aħħar, OpenAI ħarġet il-mudelli GPT-OSS-Safeguard tagħha: verżjonijiet irfinati tal-mudelli OSS 20B u 120B introdotti aktar kmieni din is-sena. Dawn il-mudelli jistgħu jinterpretaw il-politika ta’ utent direttament waqt l-inferenza, u joffru approċċ flessibbli u b’saħħtu għall-moderazzjoni tal-kontenut. Dawn il-mudelli jinsabu f’verżjoni preliminari għar-riċerka, għalhekk żgur li se jkomplu jitjiebu maż-żmien.
Ikkollaborajna ma’ OpenAI qabel dan ir-rilaxx u għamilna evalwazzjonijiet fid-dinja reali biex ngħinu fl-iżvilupp tal-mudell. F’dan l-artiklu, naqsmu tagħrif minn dik il-kollaborazzjoni u nesploraw xi jfisser dan il-progress għall-futur tal-moderazzjoni fis-sistemi tal-IA fil-produzzjoni.
Illum, is-soluzzjonijiet ta’ moderazzjoni tipikament jieħdu l-forma ta’ saffi ta’ protezzjoni madwar l-applikazzjoni. Dan il-mudell ta’ tfassil nużawh spiss f’implimentazzjonijiet pubbliċi b’volum għoli. Għal analiżi aktar fil-fond, tista’ taqra l-blog tagħna dwar dan hawnhekk.
Ikklassifika l-inputs b’mod parallel (tħallix prompts ħżiena jidħlu): Klassifikaturi żgħar u speċifiċi għas-suġġett jaħdmu fl-istess ħin biex jagħtu tikketta lil kull messaġġ tal-utent. Sibna li klassifikaturi b’fokus dejjaq huma b’mod li jista’ jitkejjel aktar affidabbli minn klassifikatur wieħed għal kollox. Eżempji few-shot magħżula bir-reqqa fil-prompt jistgħu jgħinu biex issir distinzjoni bejn “I keep getting killed by this boss” (kuntest ta’ logħba, kompletament bla ħsara) u sinjal ta’ ħsara fid-dinja reali.
Sikur → Iġġenera b’mod normali
Tentattivi ta’ jailbreak → Injorahom jew evita t-talba bi rifjut konsistenti mal-marka
Riskji għas-sikurezza jew il-benesseri → eskala għand persuna b’kuntest dettaljat
Ikklassifika l-outputs (tibgħatx tweġiba ħażina): Kull tweġiba kandidata terġa’ tiġi skrinjata qabel tintbagħat. Dan jipproteġi kontra d-devjazzjoni tal-mudell, l-avvelenament tad-data RAG u każijiet sottili ta’ eċċezzjoni fil-politika, bħal kontenut dannuż, esponiment ta’ PII jew żvelar ta’ informazzjoni sensittiva. Jekk tiġi mmarkata, nissostitwixxu t-tweġiba ġġenerata mill-LLM b’messaġġ sikur u konsistenti mal-marka, jew neskalawha għand persuna, minflok nibagħtu xi ħaġa li jiddispjaċina minnha.
Agħmilha veloċi u affordabbli: Il-bini tal-prompts bħala komponenti li jistgħu jerġgħu jintużaw jippermettilek taħżen fil-cache frammenti ta’ prompts, eżempji few-shot tal-klassifikatur u prefissi komuni tad-djalogu. Dan l-approċċ inaqqas kemm id-dewmien kif ukoll l-ispiża tal-miżuri protettivi tiegħek.
Ittratta s-sikurezza bħala parti mill-prodott Ir-rifjuti u t-twissijiet jinkitbu bit-ton tal-marka, pereżempju ferrieħi għal-logħob u formali għall-finanzi. Meta l-esperjenza tal-utent tirrispetta l-intenzjoni tiegħu, l-aċċettazzjoni tal-miżuri protettivi tiżdied u t-tentattivi ta’ jailbreak jonqsu.
Immonitorja, wettaq red teaming u agħlaq iċ-ċiklu Red teaming kontinwu u dashboards tas-sikurezza f’ħin reali jgħinu biex jinqabdu rigressjonijiet qabel ma jolqtu lill-utenti. Nistgħu ngħallmu lill-mudell dwar kull xejra ġdida ta’ attakk billi nipprovdu aktar eżempji few-shot u/jew regoli tar-rotta, biex maż-żmien is-sistema ssir aktar diffiċli biex tinkiser mingħajr ma tiġi kompromessa l-prestazzjoni tal-applikazzjoni.
Huwa diffiċli li jinbnew u jinżammu miżuri protettivi effettivi.
Fil-prattika, dan jeħtieġ kollaborazzjoni bir-reqqa bejn il-partijiet interessati ewlenin tan-negozju u l-iżviluppaturi biex tinħoloq politika definita sew. Imbagħad, ladarba l-politika tkun definita, iridu jinbnew u jiġu rfinati d-disinn u l-imġiba tas-sistema.
Il-miġja ta’ mudelli miftuħa ta’ raġunament għas-sikurezza bħal gpt-oss-safeguard għandha l-potenzjal li ssolvi wħud mid-diffikultajiet f’dan il-proċess, billi tipprovdi bażi aktar versatili u lesta għall-użu għall-moderazzjoni tal-kontenut.
Gpt-oss-safeguard għandu l-għan li jindirizza wħud mill-isfidi komuni fil-bini tas-sistemi ta’ moderazzjoni tal-lum. Dawn il-mudelli żgħar u speċjalizzati huma rfinati biex jirraġunaw fuq politika fil-mira waqt l-inferenza, u jfittxu kontenut dannuż jew sensittiv bħal tentattivi ta’ jailbreak, esponiment ta’ PII u ksur ieħor tal-politika.
Billi jinkorporaw ir-raġunament fil-proċess ta’ klassifikazzjoni tagħhom, jipprovdu moderazzjoni aktar preċiża u reżiljenti li hija aktar diffiċli biex tiġi evitata. Bħala varjanti speċjalizzati tas-sikurezza ta’ GPT-OSS 20B u 120B, joffru prestazzjoni tas-sikurezza tal-ogħla livell filwaqt li jeħtieġu konfigurazzjoni minima permezz ta’ definizzjonijiet ta’ politika personalizzati.
Evalwajna gpt-oss-safeguard 20B u 120B f’diversi kompiti simili għall-produzzjoni: assistent tal-vuċi f’ħin reali, bot ta’ appoġġ għall-plejers fil-logħob, sistema proattiva ta’ moderazzjoni taċ-chat u analiżi multilingwi tat-tossiċità bl-Ispanjol, il-Franċiż, it-Taljan, il-Portugiż, ir-Russu u t-Tork.
Moderazzjoni tal-vuċi sensittiva għad-dewmien: Fit-testijiet tagħna tal-vuċi f’ħin reali—jiġifieri klassifikazzjoni diretta waqt konverżazzjoni fejn tweġiba trid tiġi analizzata u prijoritizzata, bħal fil-moderazzjoni taċ-chat fil-logħob—gpt-oss-safeguard-20B għalaq madwar 80% tad-distakk fl-akkuratezza bejn GPT-OSS-20B u GPT-5-Mini (0.71 kontra 0.78, minn 0.45), b’dewmien ferm aktar baxx.
Eskalazzjoni tal-appoġġ għall-plejers: Fil-prijoritizzazzjoni tal-appoġġ għall-plejers, gpt-oss-safeguard-20B għalaq madwar 90% tad-distakk bejn GPT-OSS-20b u GPT-5-Mini (0.66 kontra 0.67, minn 0.57). Kiseb ukoll l-aħjar preċiżjoni makro fil-grupp, recall ta’ 88% fuq kontenut beninn u preċiżjoni ta’ 87% fl-identifikazzjoni ta’ utenti vulnerabbli—utli għal eskalazzjonijiet konservattivi u affidabbli mingħajr ma tgħarraq lir-reviżuri umani.
Moderazzjoni fuq skala kbira ta’ chat b’politika densa: Fl-aktar evalwazzjoni impenjattiva tagħna, li teħtieġ li sistema ta’ moderazzjoni timmarka b’mod proattiv messaġġi fil-logħob skont dokument dettaljat tal-politika, gpt-oss-safeguard qabeż b’marġni ċar il-linja bażi OSS, b’titjib relattiv ta’ madwar 35%, u ttratta politiki twal b’mod effettiv. Dan huwa każ ta’ użu partikolarment sensittiv li jeħtieġ recall u preċiżjoni għoljin. Jekk ir-recall ikun baxx wisq, jintilfu ħafna messaġġi dannużi. U punteġġ baxx ta’ preċiżjoni jwassal biex ħafna messaġġi irrilevanti jiġu mmarkati għall-moderaturi umani, u b’hekk l-attenzjoni tagħhom titbiegħed mill-każijiet verament diffiċli.
Prestazzjoni multilingwi: Fuq sett bilanċjat ta’ data dwar it-tossiċità f’sitt lingwi, gpt-oss-safeguard żamm qrib GPT-5-Mini, tipikament b’differenza ta’ 3–5 punti perċentwali fl-akkuratezza, filwaqt li gpt-oss-safeguard-120B mar ftit aħjar bl-Ispanjol. Osservajna differenzi kemxejn akbar f’lingwi b’inqas riżorsi bħat-Tork, iżda b’mod ġenerali l-prestazzjoni bejn il-lingwi kienet soda, b’titjib konsistenti fir-recall meta wieħed jgħaddi minn 20B għal 120B.
Osservajna wkoll li l-mudelli gpt-oss-safeguard jaħdmu tajjeb f’oqsma fejn tradizzjonalment l-LLMs huma aktar dgħajfa fil-moderazzjoni, bħad-data PII. Il-mudelli ewlenin għandhom it-tendenza li jiffavorixxu l-identifikazzjoni ta’ data PII fuq l-istil tal-Istati Uniti u jaħdmu inqas tajjeb f’reġjuni oħra. Għalhekk nemmnu li gpt-oss-safeguard se jkun utli biex jissimplifika l-konfigurazzjonijiet tal-moderazzjoni billi jnaqqas id-dipendenza fuq għodod imfassla apposta biex jaqbdu ksur żgħir tal-politiki li LLMs usa’ ma jistgħux jittrattaw.
Għalhekk, l-evalwazzjonijiet tagħna stabbilew li “mudelli fundamentali ta’ moderazzjoni” bħal gpt-oss-safeguard-20B u gpt-oss-safeguard-120B iwassluk ’il bogħod, u malajr. Madankollu, l-irfinar speċifiku għad-dominju għadu jistabbilixxi l-ogħla standard meta s-sistemi jkunu jeħtieġu l-ogħla livelli ta’ sikurezza u speċifiċità.


Għall-każ tal-użu tal-moderazzjoni fil-logħob, irfinajna klassifikatur Qwen3-0.6B permezz ta’ irfinar issorveljat fuq madwar 10,000 azzjoni storika ta’ moderaturi u eżiti ta’ politiki. Dan il-mudell jaqbeż b’marġni sostanzjali lil kull mudell bażi li ttestjajna għal dan il-kompitu, b’akkuratezza ta’ 57% meta mqabbla ma’ 15% (gpt-oss-safeguard-120B, stmata mill-proporzjon tal-prestazzjoni ta’ GPT-4.1-nano), jiġifieri żieda ta’ 42 punt jew madwar 280%. Dawn ir-riżultati jaqblu mal-gwida ta’ OpenAI li klassifikaturi iżgħar u ddedikati, imħarrġa fuq eżempji bit-tikketti, jistgħu jaqbżu lill-mudelli ta’ salvagwardja f’oqsma speċjalizzati.
Il-konklużjoni hija ċara: meta l-politiki jkunu sfumati u jkollhom ħafna każijiet ta’ eċċezzjoni, mudell żgħir irfinat għad-dominju jibqa’ l-istandard tad-deheb. Il-proċess tal-irfinar jinkorpora l-politika u l-każijiet ta’ eċċezzjoni tiegħek direttament fil-parametri, u b’hekk jagħti mġiba aktar stabbli fid-dinja kumplessa tal-produzzjoni, b’dewmien u spejjeż minimi.
L-irfinar issorveljat huwa biss wieħed minn diversi approċċi possibbli għal dan. Jistgħu jintużaw ukoll tekniki qawwija oħra ta’ taħriġ, bħall-apprendiment ta' tisħiħ jew id-distillazzjoni skont il-politika, biex il-mġiba tal-mudell tkompli tiġi ottimizzata.
L-irfinar tipikament jeħtieġ ammont kbir ta’ data. Is-sett tad-data użat biex jiġi rfinat dan il-klassifikatur Qwen3-0.6B kien ittikkettat manwalment minn moderaturi umani u, għaldaqstant, kien jirrappreżenta sors ta’ verità nadif u eċċellenti.
F’ħafna proġetti, dan il-vantaġġ ta’ data rikka jista’ ma jkunx jeżisti mill-bidu. Għalhekk, għandna t-tendenza li nqisu l-irfinar bħala ottimizzazzjoni li tista’ ssir aktar tard fiċ-ċiklu tal-iżvilupp tas-soluzzjoni. Ladarba l-forma tas-soluzzjoni tkun stabbilizzat u tkun inġabret xi data reali tal-utenti, l-iżviluppaturi jistgħu jibdew jużaw irfinar immirat biex itejbu aktar is-soluzzjonijiet ta’ moderazzjoni tagħhom.
Mudelli fundamentali ta’ moderazzjoni bħal gpt-oss-safeguard huma elementi ġodda u b’saħħithom. Għandhom il-potenzjal li jissimplifikaw b’mod sinifikanti d-disinn tas-sistemi ta’ moderazzjoni, filwaqt li jnaqqsu d-dewmien għal applikazzjonijiet f’ħin reali. Għaqqadhom ma’ klassifikaturi żgħar u mfassla apposta, u tkun tista’ tibni sistema aktar sikura u veloċi, b’inqas komponenti minn approċċ ibbażat fuq prompt li juża mudelli ġenerali kbar.
Jekk illum qed tibni jew taġġorna sistema ta’ moderazzjoni, ikkunsidra li tibda b’mudelli bħal gpt-oss-safeguard, kejjel il-prestazzjoni u daħħal titjib immirat bi klassifikaturi mfassla apposta—ibbażati fuq prompt jew irfinati—fejn id-data turi nuqqasijiet.
Tixtieq tkun taf aktar? Ibgħatilna messaġġ.