Què impliquen els models gpt-oss-safeguard d'OpenAI per a la seguretat de la IA

L'avaluació inicial dels models gpt-oss-safeguard d'OpenAI mostra com els models de seguretat especialitzats poden reforçar els sistemes d'IA en producció.

Durant els darrers dos anys, hem creat solucions que s'han ampliat de manera segura fins a arribar a milions d'usuaris. Una part clau d'aquesta feina ha estat dissenyar sistemes de moderació ràpids i precisos. Una moderació eficaç permet a les empreses desplegar amb confiança solucions d'IA d'avantguarda, protegir els usuaris finals de possibles danys i garantir la seguretat de la marca detectant les generacions no desitjades abans que esdevinguin un problema.

Recentment, OpenAI va publicar els seus models GPT-OSS-Safeguard: versions afinades dels models OSS 20B i 120B presentats a principis d'any. Aquests models poden interpretar directament la política d'un usuari durant la inferència i ofereixen un enfocament flexible i potent per moderar continguts. Aquests models es troben en fase preliminar de recerca, de manera que sens dubte continuaran millorant amb el temps.

Abans del llançament, vam col·laborar amb OpenAI fent avaluacions en entorns reals per contribuir al desenvolupament del model. En aquest article compartim les conclusions d'aquella col·laboració i analitzem què impliquen aquests avenços per al futur de la moderació en sistemes d'IA en producció.

Com funciona actualment la moderació en producció?

Actualment, les solucions de moderació solen adoptar la forma de capes de protecció al voltant de l'aplicació. Utilitzem sovint aquest patró en desplegaments públics amb un gran volum d'ús. Per aprofundir-hi, podeu consultar el nostre article sobre el tema aquí.

  1. Classifiqueu les entrades en paral·lel (no deixeu passar indicacions nocives): uns classificadors petits i especialitzats per temes s'executen simultàniament per etiquetar cada missatge de l'usuari. Hem comprovat que els classificadors amb un àmbit ben delimitat són, de manera mesurable, més fiables que un únic classificador generalista. Uns exemples amb pocs exemples ben triats a la indicació poden ajudar a distingir entre "I keep getting killed by this boss" (context d'un videojoc, completament inofensiu) i un indici de dany al món real.

    • Segur → Genera amb normalitat

    • Evasions de proteccions de seguretat → Ignora-les o desvia-les amb una negativa coherent amb la marca

    • Riscos per a la seguretat o el benestar → Deriva'ls a una persona amb prou context

  2. Classifiqueu les sortides (no envieu una resposta inadequada): cada resposta candidata es torna a examinar abans de lliurar-la. Això protegeix contra la deriva del model, l'enverinament de dades RAG i casos límit subtils de les polítiques, com ara contingut perjudicial, exposició de dades d'identificació personal o filtració d'informació sensible. Si es marca, substituïm la resposta generada per l'LLM per un missatge segur i coherent amb la marca, o la derivem a una persona, en lloc d'enviar una resposta que puguem lamentar.

  3. Feu que sigui ràpid i assequible: crear indicacions com a blocs reutilitzables permet desar a la memòria cau fragments d'indicacions, exemples amb pocs exemples dels classificadors i prefixos de diàleg habituals. Aquest enfocament permet reduir tant la latència com el cost de les mesures de protecció.

  4. Tracteu la seguretat com una part del producteLes negatives i els avisos es redacten amb el to propi de la marca (per exemple, juganer en videojocs i formal en finances). Quan l'experiència d'usuari respecta la intenció de l'usuari, augmenta l'acceptació de les mesures de protecció i disminueixen els intents d'evasió de proteccions de seguretat.

  5. Superviseu, feu proves d'equip vermell i tanqueu el cicleLes proves contínues d'equip vermell i els taulers de seguretat en directe ajuden a detectar regressions abans que afectin els usuaris. Podem ensenyar al model qualsevol patró d'atac nou proporcionant exemples addicionals amb pocs exemples o regles d'encaminament, de manera que el sistema sigui cada cop més difícil de vulnerar sense comprometre el rendiment de l'aplicació.

Reptes actuals a l'hora de crear una solució de moderació

Crear i mantenir mesures de protecció eficaces és difícil.

A la pràctica, cal una col·laboració estreta entre les principals parts interessades de l'empresa i els desenvolupadors per crear una política ben definida. Un cop definida la política, cal crear i ajustar el disseny i el comportament del sistema.

L'arribada de models oberts de raonament sobre seguretat com gpt-oss-safeguard pot resoldre alguns dels punts problemàtics d'aquest procés i oferir una base més versàtil i preparada per moderar continguts.

El potencial dels models de seguretat especialitzats

Gpt-oss-safeguard pretén abordar alguns dels reptes habituals de la creació dels sistemes de moderació actuals. Aquests models petits i especialitzats s'afinen per raonar sobre una política concreta durant la inferència i detectar contingut perjudicial o sensible, com ara evasions de proteccions de seguretat, exposició de dades d'identificació personal i altres infraccions de les polítiques.

En incorporar el raonament al procés de classificació, ofereixen una moderació més precisa, robusta i difícil d'eludir. Com a variants de seguretat especialitzades de GPT-OSS 20B i 120B, ofereixen un rendiment de seguretat d'avantguarda amb una configuració mínima gràcies a les definicions de polítiques personalitzades.

Què vam provar

Vam avaluar gpt-oss-safeguard 20B i 120B en diverses tasques representatives d'entorns de producció: un assistent de veu en temps real, un bot d'assistència a jugadors dins d'un videojoc, un sistema proactiu de moderació de xats i una anàlisi multilingüe de toxicitat (espanyol, francès, italià, portuguès, rus i turc).

Què vam descobrir

  • Moderació de veu sensible a la latència: en les nostres proves de veu en temps real —és a dir, classificació en directe dins d'una conversa en què cal analitzar i prioritzar una resposta, com en la moderació del xat d'un videojoc—, gpt-oss-safeguard-20B va reduir aproximadament un 80% la diferència de precisió entre GPT-OSS-20B i GPT-5-Mini (0,71 davant de 0,78, des de 0,45), amb una latència molt inferior.

  • Derivació de l'assistència a jugadors: en la priorització de l'assistència a jugadors, gpt-oss-safeguard-20B va reduir aproximadament un 90% la diferència entre GPT-OSS-20b i GPT-5-Mini (0,66 davant de 0,67, des de 0,57). També va oferir la millor precisió macro del conjunt, una exhaustivitat del 88% en contingut benigne i una precisió del 87% en la detecció d'usuaris vulnerables, resultats útils per fer derivacions prudents i d'alta confiança sense saturar els revisors humans.

  • Moderació a gran escala de xats amb polítiques complexes: en la nostra avaluació més exigent, que requereix que un sistema de moderació marqui proactivament els missatges d'un videojoc segons un document de polítiques detallat, gpt-oss-safeguard va superar clarament el model OSS de referència, amb una millora relativa aproximada del 35%, i va gestionar amb eficàcia polítiques llargues. És un cas d'ús especialment sensible que exigeix una exhaustivitat i una precisió elevades. Amb una exhaustivitat massa baixa, molts missatges perjudicials passarien desapercebuts. Una precisió baixa faria que es marquessin molts missatges irrellevants perquè els revisessin moderadors humans, desviant-ne l'atenció dels casos realment difícils.

  • Rendiment multilingüe: en un conjunt de dades equilibrat sobre toxicitat en sis llengües, gpt-oss-safeguard va obtenir resultats propers als de GPT-5-Mini, normalment amb una diferència de precisió de 3 a 5 punts percentuals, i gpt-oss-safeguard-120B el va superar lleugerament en espanyol. Vam observar diferències una mica més grans en llengües amb menys recursos, com el turc, però el patró general mostrava un rendiment multilingüe sòlid, amb millores constants de l'exhaustivitat en passar de 20B a 120B.

També vam observar que els models gpt-oss-safeguard ofereixen un bon rendiment en àmbits on els LLM solen ser menys eficaços en moderació, com les dades d'identificació personal. Els models generalistes tendeixen a detectar millor les dades d'identificació personal en formats nord-americans i rendeixen pitjor en altres regions. Per això, creiem que gpt-oss-safeguard serà útil per simplificar les configuracions de moderació, ja que reduirà la dependència d'eines personalitzades per detectar petites infraccions de polítiques que els LLM més generalistes no poden gestionar.

El potencial de l'afinament específic

Per tant, les nostres avaluacions han establert que els "models bàsics de moderació", com ara gpt-oss-safeguard-20B i gpt-oss-safeguard-120B, permeten arribar lluny i ràpidament. Tanmateix, els models afinats per a un domini concret continuen sent el referent quan els sistemes exigeixen els màxims nivells de seguretat i especificitat.

Captura de pantalla que il·lustra el potencial de l'afinament específic.

Per al cas d'ús de moderació dins del joc, vam afinar un classificador Qwen3-0.6B mitjançant afinament supervisat amb unes 10.000 accions històriques de moderadors i resultats d'aplicació de polítiques. Aquest model supera amb escreix tots els models base que vam provar en aquesta tasca: assoleix una precisió del 57%, davant del 15% de gpt-oss-safeguard-120B (estimació basada en la proporció del rendiment de GPT-4.1-nano), és a dir, 42 punts més i una millora aproximada del 280%. Aquests resultats coincideixen amb les directrius d'OpenAI segons les quals els classificadors més petits i específics, entrenats amb exemples etiquetats, poden superar els models de protecció en dominis especialitzats.

La conclusió és clara: quan les polítiques són complexes i tenen molts casos límit, un model petit i adaptat al domini continua sent el referent. El procés d'afinament incorpora directament la política i els casos límit als paràmetres, cosa que ofereix un comportament més estable en el complex entorn de producció, amb una latència i uns costos mínims.

L'afinament supervisat és només un dels diversos enfocaments possibles. També es poden aprofitar altres tècniques d'entrenament potents, com l'aprenentatge per reforç o la destil·lació segons la política, per optimitzar encara més el comportament del model.

La contrapartida de l'afinament

L'afinament sol requerir un gran volum de dades. El conjunt de dades utilitzat per afinar aquest classificador Qwen3-0.6B havia estat etiquetat manualment per moderadors humans i, per tant, constituïa una font de referència neta i fiable.

En molts projectes, és possible que aquest avantatge de disposar de dades riques no existeixi d'entrada. Per això, solem considerar l'afinament una optimització que es pot incorporar més endavant en el cicle de desenvolupament d'una solució. Quan la solució ja s'ha estabilitzat i s'han recopilat dades reals d'usuaris, els desenvolupadors poden començar a aplicar l'afinament específic per portar les solucions de moderació al nivell següent.

Reflexions finals

Els models bàsics de moderació com gpt-oss-safeguard són nous components sòlids. Poden simplificar considerablement el disseny dels sistemes de moderació i, alhora, reduir la latència de les aplicacions en temps real. Combinats amb classificadors petits i personalitzats, permeten crear un sistema més segur i ràpid, amb menys components que un enfocament basat en indicacions i grans models generalistes.

Si avui implementeu o actualitzeu un sistema de moderació, considereu començar amb models com gpt-oss-safeguard, mesurar-ne el rendiment i introduir millores específiques amb classificadors personalitzats —basats en indicacions o afinats— allà on les dades revelin mancances.

Voleu saber-ne més? Envieu-nos un missatge.

Autor

Douglas Adams, Romain Bourboulou, David Jasek i Atharva Tidke