De afgelopen twee jaar hebben we oplossingen gebouwd die veilig zijn opgeschaald naar miljoenen gebruikers. Een belangrijk onderdeel hiervan was het ontwerpen van snelle, nauwkeurige moderatiesystemen. Effectieve moderatie stelt bedrijven in staat geavanceerde AI-oplossingen met vertrouwen te implementeren. Eindgebruikers worden beschermd tegen schade en ongewenste uitvoer wordt onderschept voordat die problemen veroorzaakt of de merkveiligheid aantast.
Onlangs heeft OpenAI zijn GPT-OSS-Safeguard-modellen uitgebracht: afgestemde versies van de eerder dit jaar geïntroduceerde OSS-modellen met 20B en 120B parameters. Deze modellen kunnen het beleid van een gebruiker rechtstreeks tijdens inferentie interpreteren en bieden zo een flexibele en krachtige aanpak voor contentmoderatie. Deze modellen bevinden zich in de onderzoeks-preview en zullen zich ongetwijfeld blijven verbeteren.
Voorafgaand aan deze release werkten we samen met OpenAI en voerden we praktijkevaluaties uit om de ontwikkeling van het model te ondersteunen. In dit artikel delen we inzichten uit die samenwerking en onderzoeken we wat deze ontwikkelingen betekenen voor de toekomst van moderatie in operationele AI-systemen.
Moderatieoplossingen bestaan tegenwoordig meestal uit beschermingslagen rondom de toepassing. We gebruiken dit patroon veel bij publieksgerichte implementaties met grote volumes. Lees voor meer informatie onze blog hierover hier.
Classificeer invoer parallel (laat schadelijke prompts niet door): Kleine, onderwerpspecifieke classificatiemodellen draaien gelijktijdig om elk gebruikersbericht te labelen. We hebben vastgesteld dat classificatiemodellen met een smalle focus aantoonbaar betrouwbaarder zijn dan één model dat alles moet afdekken. Zorgvuldig gekozen few-shotvoorbeelden in de prompt kunnen helpen om onderscheid te maken tussen "I keep getting killed by this boss" (gamecontext, volkomen onschuldig) en een echt signaal van schade in de fysieke wereld.
Veilig → Normaal genereren
Jailbreaks → Negeren of afweren met een afwijzing die bij het merk past
Veiligheids- of welzijnsrisico's → Met uitgebreide context escaleren naar een medewerker
Classificeer uitvoer (verstuur geen schadelijk antwoord): Elk mogelijk antwoord wordt vóór verzending opnieuw gecontroleerd. Dit beschermt tegen modeldrift, datavergiftiging bij RAG en subtiele uitzonderingen in het beleid, zoals schadelijke inhoud, blootstelling van persoonsgegevens of het lekken van gevoelige informatie. Als iets wordt gemarkeerd, vervangen we het door de LLM gegenereerde antwoord door een veilig bericht dat bij het merk past, of escaleren we het naar een medewerker. Zo versturen we niets waar we later spijt van krijgen.
Maak het snel en betaalbaar: Door prompts als herbruikbare bouwstenen op te zetten, kun je promptfragmenten, few-shotvoorbeelden voor classificatiemodellen en veelgebruikte dialoogvoorvoegsels cachen. Met deze aanpak verlaag je zowel de latentie als de kosten van je veiligheidsmaatregelen.
Behandel veiligheid als onderdeel van het productAfwijzingen en waarschuwingen worden in een passende toon geschreven, bijvoorbeeld speels voor games en formeel voor financiële toepassingen. Wanneer de gebruikerservaring aansluit bij de intentie van de gebruiker, neemt de acceptatie van veiligheidsmaatregelen toe en daalt het aantal jailbreakpogingen.
Monitor, voer red teaming uit en sluit de feedbacklusDoorlopende red teaming en live veiligheidsdashboards helpen regressies te onderscheppen voordat gebruikers ermee te maken krijgen. We kunnen het model nieuwe aanvalspatronen aanleren met extra few-shotvoorbeelden en/of routeringsregels. Zo wordt het systeem na verloop van tijd moeilijker te omzeilen zonder dat dit ten koste gaat van de prestaties van de toepassing.
Het is moeilijk om effectieve veiligheidsmaatregelen te bouwen en te onderhouden.
In de praktijk moeten belangrijke zakelijke belanghebbenden en ontwikkelaars zorgvuldig samenwerken om duidelijk beleid op te stellen. Zodra het beleid is vastgesteld, moeten het systeemontwerp en het systeemgedrag worden ontwikkeld en afgestemd.
De komst van open veiligheidsmodellen met redenering, zoals gpt-oss-safeguard, kan een aantal knelpunten in dit proces oplossen door een gebruiksklare en veelzijdige basis voor contentmoderatie te bieden.
Gpt-oss-safeguard is bedoeld om enkele veelvoorkomende uitdagingen bij het bouwen van hedendaagse moderatiesystemen aan te pakken. Deze kleine, gespecialiseerde modellen zijn afgestemd om tijdens inferentie over een doelbeleid te redeneren en te zoeken naar schadelijke of gevoelige inhoud, zoals jailbreaks, blootstelling van persoonsgegevens en andere beleidsovertredingen.
Door redenering in hun classificatieproces op te nemen, bieden ze nauwkeurigere en robuustere moderatie die moeilijker te omzeilen is. Als gespecialiseerde veiligheidsvarianten van GPT-OSS 20B en 120B leveren ze geavanceerde veiligheidsprestaties, terwijl aangepaste beleidsdefinities de benodigde configuratie tot een minimum beperken.
We evalueerden gpt-oss-safeguard 20B en 120B voor diverse praktijktaken: een realtime spraakassistent, een ondersteuningsbot voor spelers in een game, een proactief chatmoderatiesysteem en een meertalige toxiciteitsscan in het Spaans, Frans, Italiaans, Portugees, Russisch en Turks.
Spraakmoderatie waarbij latentie cruciaal is: In onze realtime spraaktests, waarbij een antwoord tijdens een gesprek live moet worden geanalyseerd en beoordeeld, zoals bij moderatie van gamechats, overbrugde gpt-oss-safeguard-20B circa 80% van het nauwkeurigheidsverschil tussen GPT-OSS-20B en GPT-5-Mini (0,71 tegenover 0,78, gestegen vanaf 0,45), met een veel lagere latentie.
Escalatie bij spelersondersteuning: Bij de triage van spelersondersteuning overbrugde gpt-oss-safeguard-20B circa 90% van het verschil tussen GPT-OSS-20b en GPT-5-Mini (0,66 tegenover 0,67, gestegen vanaf 0,57). Het model behaalde ook de beste macroprecisie van de testgroep, 88% recall voor onschuldige inhoud en 87% precisie bij het detecteren van kwetsbare gebruikers. Dat is nuttig voor voorzichtige, zeer betrouwbare escalaties zonder menselijke beoordelaars te overspoelen.
Schaalbare chatmoderatie met uitgebreid beleid: In onze meest veeleisende evaluatie, waarbij een moderatiesysteem gameberichten proactief moest markeren aan de hand van een uitgebreid beleidsdocument, presteerde gpt-oss-safeguard duidelijk beter dan het OSS-basismodel. Het behaalde een relatieve verbetering van circa 35% en kon lang beleid effectief verwerken. Dit is een bijzonder gevoelige toepassing die een hoge recall en precisie vereist. Bij een te lage recall worden veel schadelijke berichten gemist. Een lage precisie zou ertoe leiden dat veel irrelevante berichten bij menselijke moderators worden gemarkeerd, waardoor hun aandacht wordt afgeleid van de werkelijk moeilijke gevallen.
Meertalige prestaties: Op een evenwichtige toxiciteitsdataset in zes talen presteerde gpt-oss-safeguard ongeveer gelijk aan GPT-5-Mini, doorgaans met een verschil van 3 tot 5 procentpunt in nauwkeurigheid. In het Spaans presteerde gpt-oss-safeguard-120B iets beter. We zagen iets grotere verschillen bij talen met minder beschikbare bronnen, zoals het Turks. Over het geheel genomen waren de meertalige prestaties echter solide, met consistente verbeteringen in recall bij de overstap van 20B naar 120B.
We zagen ook dat de gpt-oss-safeguard-modellen sterk presteren op gebieden waarop LLM's traditioneel minder goed modereren, zoals persoonsgegevens. Gangbare modellen zijn vaak meer gericht op het herkennen van Amerikaanse persoonsgegevens en presteren minder goed in andere regio's. Daarom verwachten we dat gpt-oss-safeguard moderatieconfiguraties kan vereenvoudigen door de afhankelijkheid te verminderen van maatwerktools die kleine beleidsovertredingen moeten signaleren waar bredere LLM's niet mee overweg kunnen.
Onze evaluaties tonen dus aan dat "basismodellen voor moderatie", zoals gpt-oss-safeguard-20B en gpt-oss-safeguard-120B, snel veel resultaat opleveren. Domeinspecifiek afgestemde modellen blijven echter de norm wanneer systemen aan de hoogste eisen voor veiligheid en specificiteit moeten voldoen.


Voor moderatie in games hebben we een Qwen3-0.6B-classificatiemodel via begeleid afstemmen getraind met circa 10.000 historische moderatoracties en beleidsuitkomsten. Dit model presteert bij deze taak aanzienlijk beter dan elk getest basismodel, met een nauwkeurigheid van 57% tegenover 15% (gpt-oss-safeguard-120B, geschat op basis van de verhouding tot de prestaties van GPT-4.1-nano): een stijging van 42 procentpunt, oftewel circa 280%. Deze resultaten sluiten aan bij de richtlijnen van OpenAI: kleinere, gespecialiseerde classificatiemodellen die met gelabelde voorbeelden zijn getraind, kunnen in specifieke domeinen beter presteren dan safeguard-modellen.
De conclusie is duidelijk: bij genuanceerd beleid met veel uitzonderingssituaties blijft een klein, op het domein afgestemd model de gouden standaard. Tijdens het afstemmen worden je beleid en uitzonderingssituaties rechtstreeks in de parameters vastgelegd. Dit zorgt in de rommelige productiepraktijk voor consistenter gedrag, met een minimale impact op latentie en kosten.
Begeleid afstemmen is hiervoor slechts een van de mogelijke benaderingen. Ook andere krachtige trainingstechnieken, zoals reinforcement learning of on-policy distillation, kunnen worden ingezet om het gedrag van het model verder te optimaliseren.
Voor afstemming zijn doorgaans veel gegevens nodig. De dataset waarmee dit Qwen3-0.6B-classificatiemodel werd afgestemd, was handmatig gelabeld door menselijke moderators en vormde daardoor een schone, betrouwbare bron van waarheid.
Bij veel projecten is zo'n rijke gegevensbron in het begin niet beschikbaar. Daarom zien we afstemming doorgaans als een optimalisatie voor een latere fase in de ontwikkeling van een oplossing. Zodra de vorm van de oplossing is gestabiliseerd en er echte gebruikersgegevens zijn verzameld, kunnen ontwikkelaars doelgerichte afstemming inzetten om hun moderatieoplossing naar een hoger niveau te tillen.
Basismodellen voor moderatie, zoals gpt-oss-safeguard, zijn krachtige nieuwe bouwstenen. Ze kunnen het ontwerp van moderatiesystemen aanzienlijk vereenvoudigen en tegelijk de latentie van realtime toepassingen verlagen. Combineer ze met kleine, op maat gemaakte classificatiemodellen en je kunt een veiliger en sneller systeem bouwen met minder bewegende delen dan bij een promptgebaseerde aanpak met grote algemene modellen.
Als je nu een moderatiesysteem opzet of verbetert, begin dan bijvoorbeeld met modellen als gpt-oss-safeguard. Meet de prestaties en voeg doelgerichte verbeteringen met op maat gemaakte classificatiemodellen toe, promptgebaseerd of afgestemd, waar de gegevens tekortkomingen laten zien.
Meer weten? Stuur ons een bericht.