Oleme viimase kahe aasta jooksul loonud lahendusi, mis on ohutult kasvanud miljonite kasutajateni. Selle töö oluline osa on olnud kiirete ja täpsete modereerimissüsteemide kavandamine. Tõhus modereerimine võimaldab ettevõtetel võtta tipptasemel tehisintellektilahendusi kindlalt kasutusele, kaitstes lõppkasutajaid kahju eest ja brändi mainet soovimatute väljundite tuvastamisega enne, kui need probleemiks muutuvad.
Hiljuti avaldas OpenAI oma GPT-OSS-Safeguardi mudelid: selle aasta alguses tutvustatud 20B ja 120B OSS-mudelite peenhäälestatud versioonid. Need mudelid suudavad kasutaja reegleid järeldamise ajal vahetult tõlgendada, pakkudes sisu modereerimiseks paindlikku ja võimekat lahendust. Need mudelid on teadusuuringute eelvaate järgus, seega arenevad need aja jooksul kahtlemata edasi.
Tegime enne mudelite avaldamist OpenAI-ga koostööd ja korraldasime mudeliarenduse suunamiseks tegelikke kasutusolukordi kajastavaid hindamisi. Selles artiklis jagame koostööst saadud teadmisi ja uurime, mida need edusammud tähendavad tootmiskeskkonna tehisintellektisüsteemide modereerimise tulevikule.
Tänapäeval koosnevad modereerimislahendused tavaliselt rakendust ümbritsevatest kaitsekihtidest. Kasutame seda mustrit sageli suure kasutusmahuga avalikes juurutustes. Põhjalikuma ülevaate leiate meie selleteemalisest blogipostitusest siit.
Klassifitseerige sisendeid paralleelselt (ärge laske halbu viipasid sisse): väikesed teemapõhised klassifitseerijad töötavad korraga ja märgendavad iga kasutaja sõnumi. Oleme leidnud, et kitsa fookusega klassifitseerijad on mõõdetavalt töökindlamad kui üks universaalne klassifitseerija. Hoolikalt valitud väheste näidetega viip aitab eristada lauset “I keep getting killed by this boss” (mängukontekst, täiesti ohutu) tegelikust kahjuohust.
Ohutu → genereerige tavapäraselt
Jailbreak’id → eirake või vastake brändi stiiliga sobiva keeldumisega
Ohutus- või heaoluriskid → edastage koos põhjaliku kontekstiga inimesele
Klassifitseerige väljundeid (ärge väljastage halba vastust): iga võimalikku vastust kontrollitakse enne edastamist uuesti. See kaitseb mudeli triivi, RAG-andmete mürgitamise ja reeglite peente erandjuhtumite eest, nagu kahjulik sisu, isikuandmete avaldamine või tundliku teabe lekkimine. Kui vastus märgistatakse, asendame LLM-i genereeritud vastuse ohutu ja brändi stiiliga sobiva sõnumiga või edastame selle inimesele, selle asemel et väljastada midagi, mida hiljem kahetseme.
Muutke lahendus kiireks ja taskukohaseks: viipade loomine korduskasutatavate ehitusplokkidena võimaldab vahemällu salvestada viibafragmente, klassifitseerija väheseid näiteid ja levinud dialoogialgusi. See lähenemisviis vähendab kaitsemeetmete latentsust ja kulusid.
Käsitlege ohutust toote kasutuskogemuse osanaKeeldumised ja hoiatused kirjutatakse brändi hääletooniga (nt mängudes mänguliselt, finantsvaldkonnas ametlikult). Kui kasutuskogemus arvestab kasutaja kavatsusega, suureneb kaitsemeetmete omaksvõtt ja väheneb jailbreak’i katsete arv.
Jälgige, tehke löökteste ja looge tagasisideahelPidev lööktestimine ja reaalajas ohutuse juhtpaneelid aitavad taandarengud tuvastada enne, kui need kasutajateni jõuavad. Saame mudelile uusi ründemustreid õpetada, lisades väheseid näiteid ja/või marsruutimisreegleid. Nii muutub süsteem aja jooksul raskemini murtavaks, ilma et rakenduse jõudlus kannataks.
Tõhusate kaitsemeetmete loomine ja haldamine on keeruline.
Praktikas nõuab selgete reeglite koostamine ettevõtte peamiste sidusrühmade ja arendajate hoolikat koostööd. Kui reeglid on määratletud, tuleb luua ja häälestada süsteemi ülesehitus ning käitumine.
Avatud ohutusarutluse mudelid, nagu gpt-oss-safeguard, võivad lahendada osa selle protsessi kitsaskohti, pakkudes sisu modereerimiseks kasutusvalmimat ja mitmekülgsemat alust.
Gpt-oss-safeguardi eesmärk on lahendada osa tänapäeva modereerimissüsteemide loomisel levinud probleemidest. Need väikesed spetsiaalsed mudelid on peenhäälestatud järeldamise ajal sihtreeglite üle arutlema ning otsima kahjulikku või tundlikku sisu, nagu jailbreak’id, isikuandmete avaldamine ja muud reeglite rikkumised.
Arutluse kaasamine klassifitseerimisprotsessi tagab täpsema ja töökindlama modereerimise, millest on raskem mööda pääseda. GPT-OSS 20B ja 120B spetsiaalsete ohutusvariantidena pakuvad need tipptasemel ohutust ning vajavad kohandatud reeglimääratluste tõttu väga vähe seadistamist.
Hindasime gpt-oss-safeguard 20B ja 120B mudeleid mitme tootmiskeskkonda jäljendava ülesandega: reaalajas häälassistent, mängusisene mängijatoe robot, ennetav vestluste modereerimissüsteem ja mitmekeelne toksilisuse analüüs (hispaania, prantsuse, itaalia, portugali, vene ja türgi keeles).
Latentsustundlik häälmodereerimine: meie reaalajas häälkatsetes — näiteks vestluse reaalajas klassifitseerimisel, kus vastust tuleb analüüsida ja tähtsuse järgi suunata, nagu mänguvestluse modereerimisel — vähendas gpt-oss-safeguard-20B GPT-OSS-20B ja GPT-5-Mini täpsuse erinevust ligikaudu 80% (0,71 vs. 0,78, algtasemelt 0,45), töötades seejuures märksa väiksema latentsusega.
Mängijatoele edastamine: mängijatoe juhtumite suunamisel vähendas gpt-oss-safeguard-20B GPT-OSS-20b ja GPT-5-Mini tulemuste erinevust ligikaudu 90% (0,66 vs. 0,67, algtasemelt 0,57). Samuti saavutas see katserühma parima makrotäpsuse, ohutu sisu puhul 88% saagise ja haavatavate kasutajate tuvastamisel 87% täpsuse. See on kasulik, kui soovite konservatiivset ja usaldusväärset edastamist ilma inimestest ülevaatajaid üle koormamata.
Mahukas ja reeglitihe vestluste modereerimine: meie kõige nõudlikumas hindamises, kus modereerimissüsteem peab tiheda reeglidokumendi alusel mängusiseseid sõnumeid ennetavalt märgistama, edestas gpt-oss-safeguard selgelt OSS-i baastaset, saavutades ligikaudu 35% suhtelise kasvu ja töödeldes tõhusalt pikki reeglistikke. See on eriti tundlik kasutusjuht, mis nõuab suurt saagist ja täpsust. Liiga väikese saagise korral jäävad paljud kahjulikud sõnumid märkamata. Väike täpsus tähendaks aga paljude ebaoluliste sõnumite saatmist moderaatoritele, juhtides nende tähelepanu tõeliselt keerulistelt juhtumitelt kõrvale.
Mitmekeelne toimivus: kuut keelt hõlmavas tasakaalustatud toksilisuse andmestikus püsis gpt-oss-safeguard GPT-5-Miniga peaaegu samal tasemel: täpsuse erinevus oli tavaliselt 3–5 protsendipunkti ning hispaania keeles jõudis gpt-oss-safeguard-120B napilt ette. Väiksema andmeressursiga keeltes, näiteks türgi keeles, täheldasime veidi suuremaid erinevusi. Üldiselt oli mitmekeelne toimivus siiski hea ning üleminek 20B-lt 120B-le parandas saagist järjepidevalt.
Samuti täheldasime, et gpt-oss-safeguardi mudelid toimivad hästi valdkondades, kus LLM-id on modereerimisel tavaliselt nõrgemad, näiteks isikuandmete puhul. Peavoolumudelid kalduvad paremini tuvastama USA vormingus isikuandmeid ja toimivad teistes piirkondades kehvemini. Seetõttu usume, et gpt-oss-safeguard aitab modereerimislahendusi lihtsustada, vähendades vajadust kohandatud tööriistade järele selliste väikeste reeglirikkumiste tuvastamisel, millega üldisemad LLM-id toime ei tule.
Meie hindamised näitasid, et selliste „modereerimise baasmudelitega“ nagu gpt-oss-safeguard-20B ja gpt-oss-safeguard-120B jõuab kiiresti kaugele. Valdkonnapõhised peenhäälestatud mudelid on siiski endiselt mõõdupuuks, kui süsteemid peavad vastama kõrgeimatele ohutus- ja täpsusnõuetele.


Mängusisese modereerimise jaoks peenhäälestasime Qwen3-0.6B klassifitseerija järelevalvega peenhäälestuse teel, kasutades ligikaudu 10 000 varasemat moderaatorite toimingut ja reeglite rakendamise tulemust. See mudel edestab selle ülesande puhul suurelt kõiki katsetatud baasmudeleid: selle täpsus on 57% võrreldes 15%-ga (gpt-oss-safeguard-120B, hinnatud GPT-4.1-nano tulemuse suhte alusel), mis tähendab 42 protsendipunkti ehk ligikaudu 280% kasvu. Need tulemused on kooskõlas OpenAI suunistega, mille kohaselt võivad märgendatud näidetel treenitud väiksemad eriotstarbelised klassifitseerijad erivaldkondades kaitsemudeleid edestada.
Järeldus on selge: kui reeglid on nüansirikkad ja sisaldavad palju erandjuhtumeid, on väike valdkonnale kohandatud mudel endiselt parim valik. Peenhäälestus talletab reeglid ja erandjuhtumid otse mudeli parameetritesse, tagades tootmiskeskkonna keerukates oludes ühtlasema käitumise ning väga väikese latentsuse ja kuluga.
Järelevalvega peenhäälestus on vaid üks mitmest võimalikust lähenemisviisist. Mudeli käitumist saab veelgi optimeerida ka muude tõhusate treeningmeetoditega, nagu kinnistav õppimine või käituspoliitikal põhinev destilleerimine.
Peenhäälestus nõuab tavaliselt palju andmeid. Qwen3-0.6B klassifitseerija peenhäälestuseks kasutatud andmestiku olid moderaatorid käsitsi märgendanud, mistõttu oli see puhas ja usaldusväärne tõeallikas.
Paljude projektide alguses ei pruugi nii väärtuslikke andmeid olla. Seetõttu käsitleme peenhäälestust enamasti optimeerimisena, mida saab rakendada lahenduse arendustsükli hilisemas etapis. Kui lahenduse põhikuju on stabiliseerunud ja kogutud on tegelike kasutajate andmeid, saavad arendajad viia oma modereerimislahendused sihipärase peenhäälestusega järgmisele tasemele.
Sellised modereerimise baasmudelid nagu gpt-oss-safeguard on võimekad uued ehitusplokid. Need võivad modereerimissüsteemide kavandamist märgatavalt lihtsustada ja vähendada reaalajarakenduste latentsust. Koos väikeste kohandatud klassifitseerijatega saab luua ohutuma ja kiirema süsteemi, milles on vähem liikuvaid osi kui suuri üldotstarbelisi mudeleid ja viipasid kasutavas lahenduses.
Kui loote või uuendate praegu modereerimissüsteemi, kaaluge alustamist mudelitest nagu gpt-oss-safeguard. Mõõtke nende toimivust ja lisage kohandatud klassifitseerijatega — viibapõhiste või peenhäälestatutega — sihipäraseid täiustusi seal, kus andmed näitavad puudujääke.
Kas soovite rohkem teada? Saatke meile sõnum.