Navegação principal

O que os modelos gpt-oss-safeguard da OpenAI representam para a segurança da IA

A avaliação inicial dos modelos gpt-oss-safeguard da OpenAI mostra como modelos de segurança especializados podem fortalecer sistemas de IA em produção.

Nos últimos dois anos, criamos soluções que escalaram com segurança para milhões de usuários. Uma parte essencial desse trabalho foi projetar sistemas de moderação rápidos e precisos. Uma moderação eficaz permite que as empresas implementem soluções avançadas de IA com confiança, protegendo os usuários finais contra danos e preservando a segurança da marca ao detectar gerações indesejadas antes que se tornem um problema.

Recentemente, a OpenAI lançou seus modelos GPT-OSS-Safeguard: versões com ajuste fino dos modelos OSS de 20B e 120B apresentados no início deste ano. Esses modelos interpretam diretamente a política do usuário durante a inferência, oferecendo uma abordagem flexível e poderosa à moderação de conteúdo. Esses modelos estão em prévia de pesquisa e, sem dúvida, continuarão melhorando ao longo do tempo.

Colaboramos com a OpenAI antes desse lançamento, realizando avaliações em situações reais para orientar o desenvolvimento dos modelos. Neste artigo, compartilhamos aprendizados dessa colaboração e exploramos o que esses avanços representam para o futuro da moderação em sistemas de IA em produção.

Como funciona a moderação em produção hoje?

Hoje, as soluções de moderação geralmente assumem a forma de camadas de proteção ao redor da aplicação. Usamos muito esse padrão em implementações públicas e de grande volume. Para se aprofundar no assunto, confira nosso artigo aqui.

  1. Classifique as entradas em paralelo (não deixe prompts mal-intencionados entrarem): classificadores pequenos e específicos por tema são executados simultaneamente para rotular cada mensagem do usuário. Constatamos que classificadores com foco restrito são comprovadamente mais confiáveis do que uma única solução genérica. Exemplos few-shot cuidadosamente escolhidos no prompt podem ajudar a distinguir entre "I keep getting killed by this boss" (contexto de jogo, totalmente inofensivo) e um sinal de dano no mundo real.

    • Seguro → Gerar normalmente

    • Jailbreak → Ignorar ou desviar com uma recusa alinhada à marca

    • Riscos à segurança ou ao bem-estar → encaminhar a uma pessoa com contexto detalhado

  2. Classifique as saídas (não envie uma resposta inadequada): cada resposta candidata passa por uma nova verificação antes do envio. Isso protege contra desvio do modelo, envenenamento de dados de RAG e casos-limite sutis das políticas, como conteúdo nocivo, exposição de dados de identificação pessoal ou vazamento de informações confidenciais. Quando uma resposta é sinalizada, substituímos a resposta gerada pelo LLM por uma mensagem segura e alinhada à marca ou a encaminhamos a uma pessoa, em vez de enviar algo de que nos arrependeremos.

  3. Torne tudo rápido e acessível: estruturar prompts como componentes reutilizáveis permite armazenar em cache fragmentos de prompts, exemplos few-shot dos classificadores e prefixos comuns de diálogos. Essa abordagem permite reduzir tanto a latência quanto o custo das proteções.

  4. Trate a segurança como parte do produtoAs recusas e advertências são escritas no tom da marca — por exemplo, descontraído para jogos e formal para finanças. Quando a experiência do usuário respeita sua intenção, a aceitação das proteções aumenta e as tentativas de jailbreak diminuem.

  5. Monitore, faça red teaming e feche o cicloO red teaming contínuo e os painéis de segurança em tempo real ajudam a detectar regressões antes que afetem os usuários. Podemos ensinar ao modelo novos padrões de ataque fornecendo mais exemplos few-shot e/ou regras de roteamento. Assim, o sistema se torna cada vez mais difícil de violar sem comprometer o desempenho da aplicação.

Desafios atuais na criação de uma solução de moderação

Criar e manter proteções eficazes é difícil.

Na prática, isso exige uma colaboração cuidadosa entre as principais partes interessadas da empresa e os desenvolvedores para criar uma política bem definida. Depois que a política é definida, é preciso desenvolver e ajustar tanto a arquitetura quanto o comportamento do sistema.

O surgimento de modelos abertos de raciocínio voltados à segurança, como o gpt-oss-safeguard, pode resolver alguns dos pontos problemáticos desse processo, oferecendo uma base mais versátil e pronta para uso na moderação de conteúdo.

O potencial dos modelos de segurança especializados

O gpt-oss-safeguard busca enfrentar alguns dos desafios comuns na criação dos sistemas de moderação atuais. Esses modelos pequenos e especializados recebem ajuste fino para raciocinar sobre uma política-alvo durante a inferência, identificando conteúdo nocivo ou sensível, como jailbreak, exposição de dados de identificação pessoal e outras violações de políticas.

Ao incorporar o raciocínio ao processo de classificação, eles oferecem uma moderação mais precisa, resiliente e difícil de contornar. Como variantes especializadas em segurança do GPT-OSS 20B e 120B, eles oferecem desempenho de ponta em segurança e exigem uma configuração mínima, graças às definições de políticas personalizadas.

O que testamos

Avaliamos o gpt-oss-safeguard 20B e 120B em várias tarefas semelhantes às de produção: um assistente de voz em tempo real, um bot de suporte a jogadores dentro do jogo, um sistema proativo de moderação de chat e uma análise multilíngue de toxicidade em espanhol, francês, italiano, português, russo e turco.

O que descobrimos

  • Moderação de voz sensível à latência: em nossos testes de voz em tempo real — uma classificação ao vivo durante uma conversa, na qual uma resposta precisa ser analisada e encaminhada, como na moderação de chats de jogos —, o gpt-oss-safeguard-20B eliminou cerca de 80% da diferença de acurácia entre o GPT-OSS-20B e o GPT-5-Mini (0,71 contra 0,78, ante 0,45), com latência muito menor.

  • Encaminhamento no suporte a jogadores: na triagem do suporte a jogadores, o gpt-oss-safeguard-20B eliminou cerca de 90% da diferença entre o GPT-OSS-20b e o GPT-5-Mini (0,66 contra 0,67, ante 0,57). Ele também apresentou a melhor macroprecisão do conjunto, 88% de recall em conteúdo benigno e 87% de precisão na detecção de usuários vulneráveis — útil para encaminhamentos conservadores e altamente confiáveis, sem sobrecarregar os revisores humanos.

  • Moderação de chat em escala com políticas extensas: em nossa avaliação mais exigente, na qual um sistema de moderação precisa sinalizar proativamente mensagens dentro do jogo de acordo com um documento de política detalhado, o gpt-oss-safeguard superou claramente o modelo-base OSS, com um ganho relativo de cerca de 35%, além de lidar bem com políticas longas. Esse é um caso de uso especialmente sensível, que exige recall e precisão elevados. Com um recall muito baixo, muitas mensagens nocivas não serão detectadas. Já uma precisão baixa faria com que muitas mensagens irrelevantes fossem encaminhadas aos moderadores humanos, desviando sua atenção dos casos realmente difíceis.

  • Desempenho multilíngue: em um conjunto de dados equilibrado de toxicidade em seis idiomas, o gpt-oss-safeguard apresentou resultados próximos aos do GPT-5-Mini, normalmente com uma diferença de 3 a 5 pontos percentuais na acurácia; em espanhol, o gpt-oss-safeguard-120B ficou ligeiramente à frente. Observamos diferenças um pouco maiores em idiomas com menos recursos, como o turco, mas o padrão geral indicou um sólido desempenho entre idiomas, com ganhos consistentes de recall na passagem do 20B para o 120B.

Também observamos que os modelos gpt-oss-safeguard têm bom desempenho em áreas nas quais os LLMs costumam ser mais fracos na moderação, como dados de identificação pessoal. Modelos convencionais tendem a favorecer a identificação de dados nos formatos usados nos EUA e apresentam desempenho inferior em outras regiões. Por isso, acreditamos que o gpt-oss-safeguard será útil para simplificar as configurações de moderação, reduzindo a dependência de ferramentas personalizadas para detectar pequenas violações de políticas que LLMs mais abrangentes não conseguem identificar.

O poder do ajuste fino direcionado

Assim, nossas avaliações demonstraram que "modelos-base de moderação", como gpt-oss-safeguard-20B e gpt-oss-safeguard-120B, permitem avançar muito e com rapidez. No entanto, ajustes finos específicos para cada domínio ainda definem o padrão quando os sistemas exigem os mais altos níveis de segurança e especificidade.

Captura de tela que ilustra o poder do ajuste fino direcionado.

No caso de uso de moderação dentro do jogo, aplicamos ajuste fino a um classificador Qwen3-0.6B por meio de ajuste fino supervisionado, usando cerca de 10 mil ações anteriores de moderadores e resultados de políticas. Esse modelo supera por ampla margem todos os modelos-base que testamos nessa tarefa, alcançando 57% de acurácia contra 15% do gpt-oss-safeguard-120B (estimativa baseada na proporção do desempenho do GPT-4.1-nano): um ganho de 42 pontos, ou cerca de 280%. Esses resultados estão alinhados à orientação da OpenAI de que classificadores menores e dedicados, treinados com exemplos rotulados, podem superar modelos de proteção em domínios especializados.

A conclusão é clara: quando as políticas têm nuances e muitos casos-limite, um modelo pequeno e ajustado ao domínio continua sendo o padrão-ouro. O processo de ajuste fino incorpora sua política e os casos-limite diretamente aos parâmetros, produzindo um comportamento mais consistente no ambiente complexo de produção, com impacto mínimo na latência e nos custos.

O ajuste fino supervisionado é apenas uma das várias abordagens possíveis. Também é possível aproveitar outras técnicas avançadas de treinamento, como aprendizado por reforço ou destilação on-policy, para otimizar ainda mais o comportamento do modelo.

A ressalva do ajuste fino

O ajuste fino geralmente exige muitos dados. O conjunto de dados usado no ajuste fino desse classificador Qwen3-0.6B havia sido rotulado manualmente por moderadores humanos e, portanto, representava uma fonte confiável e depurada da verdade.

Em muitos projetos, essa vantagem de dispor de dados tão ricos pode não existir no início. Por isso, costumamos considerar o ajuste fino uma otimização que pode ser feita mais adiante no ciclo de desenvolvimento da solução. Depois que a estrutura da solução estiver estabilizada e alguns dados reais de usuários tiverem sido coletados, os desenvolvedores poderão recorrer ao ajuste fino direcionado para elevar suas soluções de moderação a outro nível.

Considerações finais

Modelos-base de moderação como o gpt-oss-safeguard são novos componentes poderosos. Eles têm o potencial de simplificar significativamente o projeto de sistemas de moderação e, ao mesmo tempo, reduzir a latência de aplicações em tempo real. Combine-os com classificadores pequenos e personalizados para criar um sistema mais seguro e rápido, com menos componentes do que uma abordagem baseada em prompts e grandes modelos generalistas.

Se você está implementando ou modernizando a moderação hoje, considere começar com modelos como o gpt-oss-safeguard, medir o desempenho e introduzir melhorias direcionadas com classificadores personalizados — baseados em prompts ou com ajuste fino — onde os dados revelarem lacunas.

Quer saber mais? Envie uma mensagem para nós.

Autor

Douglas Adams, Romain Bourboulou, David Jasek, Atharva Tidke