Navegación principal

Qué implican los modelos gpt-oss-safeguard de OpenAI para la seguridad de la IA

La evaluación inicial de los modelos gpt-oss-safeguard de OpenAI muestra cómo los modelos de seguridad especializados pueden reforzar los sistemas de IA en producción.

Durante los dos últimos años, hemos creado soluciones que han crecido de forma segura hasta atender a millones de usuarios. Una parte esencial de este trabajo ha sido diseñar sistemas de moderación rápidos y precisos. Una moderación eficaz permite a las empresas implantar con confianza soluciones de IA de vanguardia, proteger a los usuarios finales y preservar la seguridad de la marca al detectar contenidos generados no deseados antes de que causen problemas.

Recientemente, OpenAI presentó sus modelos GPT-OSS-Safeguard: versiones con ajuste fino de los modelos OSS 20B y 120B presentados a principios de este año. Estos modelos pueden interpretar directamente la política de un usuario durante la inferencia, lo que ofrece un enfoque flexible y potente para moderar contenidos. Estos modelos se encuentran en fase preliminar de investigación, por lo que sin duda seguirán mejorando.

Colaboramos con OpenAI antes del lanzamiento mediante evaluaciones en situaciones reales que sirvieron para orientar el desarrollo del modelo. En este artículo compartimos lo aprendido durante esa colaboración y analizamos qué implican estos avances para el futuro de la moderación en sistemas de IA en producción.

¿Cómo funciona actualmente la moderación en producción?

Hoy en día, las soluciones de moderación suelen adoptar la forma de varias capas de protección alrededor de la aplicación. Utilizamos mucho este patrón en implantaciones públicas con un gran volumen de uso. Para profundizar en el tema, puede consultar nuestro artículo aquí.

  1. Clasificar las entradas en paralelo (impedir la entrada de prompts dañinos): pequeños clasificadores específicos para cada tema se ejecutan simultáneamente para etiquetar cada mensaje del usuario. Hemos comprobado que los clasificadores con un ámbito limitado son considerablemente más fiables que un único clasificador generalista. Elegir con cuidado ejemplos de pocos ejemplos para el prompt puede ayudar a distinguir entre «Este jefe no para de matarme» —un contexto de videojuego totalmente inocuo— y una señal de daño en el mundo real.

    • Seguro → Generar con normalidad

    • Jailbreaks → Ignorarlos o desviarlos con una negativa acorde con la marca

    • Riesgos para la seguridad o el bienestar → Derivarlos a una persona con contexto detallado

  2. Clasificar las salidas (no entregar respuestas dañinas): cada posible respuesta vuelve a examinarse antes de entregarla. Esto protege frente a la deriva del modelo, el envenenamiento de datos RAG y casos límite sutiles de las políticas, como contenido dañino, exposición de datos personales o filtraciones de información sensible. Si se marca una respuesta, sustituimos la generada por el LLM por un mensaje seguro y acorde con la marca, o la derivamos a una persona, en lugar de entregar algo de lo que podamos arrepentirnos.

  3. Lograr rapidez y un coste asequible: estructurar los prompts como componentes reutilizables permite almacenar en caché fragmentos de prompts, ejemplos de pocos ejemplos para clasificadores y comienzos de diálogo frecuentes. Este enfoque permite reducir tanto la latencia como el coste de las medidas de protección.

  4. Tratar la seguridad como parte del productoLas negativas y advertencias se redactan con la voz de la marca —por ejemplo, desenfadada en videojuegos y formal en finanzas—. Cuando la experiencia de usuario respeta su intención, aumenta la aceptación de las medidas de protección y disminuyen los intentos de jailbreak.

  5. Supervisar, aplicar red teaming y cerrar el cicloEl red teaming continuo y los paneles de seguridad en tiempo real ayudan a detectar regresiones antes de que afecten a los usuarios. Podemos enseñar al modelo nuevos patrones de ataque mediante ejemplos adicionales de pocos ejemplos o reglas de enrutamiento, de modo que el sistema sea cada vez más difícil de vulnerar sin perjudicar el rendimiento de la aplicación.

Retos actuales al crear una solución de moderación

Crear y mantener medidas de protección eficaces resulta difícil.

En la práctica, exige una estrecha colaboración entre los principales responsables del negocio y los desarrolladores para crear una política bien definida. Una vez definida la política, hay que crear y ajustar el diseño y el comportamiento del sistema.

La llegada de modelos abiertos de razonamiento para la seguridad, como gpt-oss-safeguard, puede resolver algunos de los problemas de este proceso al ofrecer una base más versátil y lista para usar en la moderación de contenidos.

El potencial de los modelos de seguridad especializados

Gpt-oss-safeguard pretende resolver algunos de los retos habituales al crear los sistemas de moderación actuales. Estos modelos pequeños y especializados reciben un ajuste fino para razonar sobre una política concreta durante la inferencia y buscar contenido dañino o sensible, como jailbreaks, exposición de datos personales y otras infracciones de las políticas.

Al incorporar el razonamiento a su proceso de clasificación, ofrecen una moderación más precisa, robusta y difícil de eludir. Como variantes de seguridad especializadas de GPT-OSS 20B y 120B, ofrecen un rendimiento de seguridad de vanguardia y requieren muy poca configuración gracias a las definiciones de políticas personalizadas.

Qué probamos

Evaluamos gpt-oss-safeguard 20B y 120B en varias tareas similares a las de producción: un asistente de voz en tiempo real, un bot de asistencia para jugadores, un sistema proactivo de moderación de chats y un análisis multilingüe de toxicidad —español, francés, italiano, portugués, ruso y turco—.

Qué descubrimos

  • Moderación de voz sensible a la latencia: en nuestras pruebas de voz en tiempo real —clasificación en directo dentro de una conversación en la que una respuesta debe analizarse y priorizarse, como en la moderación del chat de un videojuego—, gpt-oss-safeguard-20B redujo aproximadamente un 80 % la diferencia de exactitud entre GPT-OSS-20B y GPT-5-Mini (0,71 frente a 0,78, desde 0,45), con una latencia muy inferior.

  • Derivación de la asistencia a jugadores: al priorizar casos de asistencia a jugadores, gpt-oss-safeguard-20B redujo aproximadamente un 90 % la diferencia entre GPT-OSS-20b y GPT-5-Mini (0,66 frente a 0,67, desde 0,57). También logró la mejor macroprecisión del conjunto, una exhaustividad del 88 % en contenido inocuo y una precisión del 87 % al detectar usuarios vulnerables, algo útil para realizar derivaciones prudentes y fiables sin saturar a los revisores humanos.

  • Moderación a gran escala de chats con políticas complejas: en nuestra evaluación más exigente, que requiere que un sistema de moderación marque de forma proactiva los mensajes de un videojuego según un documento de políticas complejo, gpt-oss-safeguard superó claramente la referencia OSS, con una mejora relativa aproximada del 35 %, y gestionó eficazmente políticas extensas. Se trata de un caso de uso especialmente delicado que exige una exhaustividad y una precisión elevadas. Si la exhaustividad es demasiado baja, pasarán inadvertidos muchos mensajes dañinos. Y una precisión baja haría que se marcasen muchos mensajes irrelevantes para su revisión por moderadores humanos, desviando su atención de los casos realmente difíciles.

  • Rendimiento multilingüe: en un conjunto de datos equilibrado sobre toxicidad en seis idiomas, gpt-oss-safeguard mantuvo un rendimiento cercano al de GPT-5-Mini, normalmente a entre 3 y 5 puntos porcentuales de exactitud, y gpt-oss-safeguard-120B llegó a superarlo ligeramente en español. Observamos diferencias algo mayores en idiomas con menos recursos, como el turco, pero el patrón general mostró un rendimiento multilingüe sólido, con mejoras constantes de la exhaustividad al pasar de 20B a 120B.

También observamos que los modelos gpt-oss-safeguard destacan en ámbitos donde los LLM suelen rendir peor en moderación, como los datos personales: los modelos generalistas tienden a identificar mejor los formatos estadounidenses y ofrecen peores resultados en otras regiones. Por ello, creemos que gpt-oss-safeguard resultará útil para simplificar la configuración de la moderación, ya que reduce la dependencia de herramientas personalizadas para detectar pequeñas infracciones de políticas que los LLM más generales no pueden gestionar.

El potencial del ajuste fino específico

Así pues, nuestras evaluaciones demuestran que los «modelos fundacionales de moderación», como gpt-oss-safeguard-20B y gpt-oss-safeguard-120B, permiten avanzar mucho y con rapidez. Sin embargo, los modelos con ajuste fino para dominios específicos siguen marcando la pauta cuando los sistemas exigen los máximos niveles de seguridad y precisión.

Captura de pantalla que ilustra el potencial del ajuste fino específico.

Para el caso de uso de moderación en videojuegos, aplicamos un ajuste fino a un clasificador Qwen3-0.6B mediante ajuste fino supervisado con unas 10 000 acciones históricas de moderadores y sus correspondientes resultados según las políticas. Este modelo supera ampliamente a todos los modelos base que probamos en esta tarea: alcanza una exactitud del 57 % frente al 15 % de gpt-oss-safeguard-120B (estimación basada en la proporción del rendimiento de GPT-4.1-nano), una mejora de 42 puntos, aproximadamente un 280 %. Estos resultados concuerdan con las indicaciones de OpenAI: los clasificadores más pequeños y especializados, entrenados con ejemplos etiquetados, pueden superar a los modelos de protección en dominios especializados.

La conclusión es clara: cuando las políticas tienen muchos matices y casos límite, un modelo pequeño adaptado al dominio sigue siendo el referente. El proceso de ajuste fino incorpora la política y los casos límite directamente a los parámetros, lo que ofrece un comportamiento más estable ante la complejidad de los entornos de producción, con una latencia y un coste mínimos.

El ajuste fino supervisado es solo uno de los posibles enfoques. También pueden aprovecharse otras técnicas potentes de entrenamiento, como el aprendizaje por refuerzo o la destilación basada en la política actual, para optimizar aún más el comportamiento del modelo.

La salvedad del ajuste fino

El ajuste fino suele requerir una gran cantidad de datos. El conjunto de datos empleado para aplicar el ajuste fino a este clasificador Qwen3-0.6B había sido etiquetado manualmente por moderadores humanos, por lo que constituía una fuente de referencia depurada y fiable.

En muchos proyectos, esta ventaja de disponer de datos de calidad puede no existir al principio. Por ello, solemos considerar el ajuste fino una optimización que puede incorporarse en una fase posterior del ciclo de desarrollo de la solución. Una vez estabilizada la estructura de la solución y recopilados algunos datos de usuarios reales, los desarrolladores pueden recurrir al ajuste fino específico para llevar sus soluciones de moderación al siguiente nivel.

Reflexiones finales

Los modelos fundacionales de moderación como gpt-oss-safeguard son nuevos componentes muy sólidos. Pueden simplificar considerablemente el diseño de los sistemas de moderación y, al mismo tiempo, reducir la latencia de las aplicaciones en tiempo real. Al combinarlos con clasificadores pequeños y personalizados, se puede crear un sistema más seguro y rápido, con menos componentes que un enfoque basado en prompts y grandes modelos generalistas.

Si está implantando o actualizando un sistema de moderación, considere empezar por modelos como gpt-oss-safeguard, medir su rendimiento e incorporar mejoras específicas mediante clasificadores personalizados —basados en prompts o con ajuste fino— allí donde los datos revelen carencias.

¿Quiere saber más? Envíenos un mensaje.

Autor

Douglas Adams, Romain Bourboulou, David Jasek y Atharva Tidke