Navigation principale

Ce que les modèles gpt-oss-safeguard d’OpenAI signifient pour la sécurité de l’IA

Une première évaluation des modèles gpt-oss-safeguard d’OpenAI montre comment des modèles de sécurité spécialisés peuvent renforcer les systèmes d’IA en production.

Au cours des deux dernières années, nous avons conçu des solutions déployées en toute sécurité auprès de millions d’utilisateurs. La conception de systèmes de modération rapides et précis a été un élément essentiel de ce travail. Une modération efficace permet aux entreprises de déployer en toute confiance des solutions d’IA de pointe, de protéger les utilisateurs contre les préjudices et d’assurer la sécurité de la marque en interceptant les générations indésirables avant qu’elles posent problème.

Récemment, OpenAI a lancé ses modèles GPT-OSS-Safeguard, des versions ajustées des modèles OSS 20B et 120B présentés plus tôt cette année. Ces modèles peuvent interpréter directement la politique d’un utilisateur au moment de l’inférence, offrant une approche souple et puissante de la modération de contenu. Ces modèles sont offerts en aperçu de recherche et continueront sans aucun doute de s’améliorer.

Nous avons collaboré avec OpenAI avant ce lancement en menant des évaluations en conditions réelles afin d’orienter le développement des modèles. Dans cet article, nous présentons les enseignements tirés de cette collaboration et examinons ce que ces avancées signifient pour l’avenir de la modération dans les systèmes d’IA en production.

Comment fonctionne actuellement la modération en production?

Aujourd’hui, les solutions de modération prennent généralement la forme de couches de protection entourant l’application. Nous utilisons souvent ce modèle de conception pour les déploiements publics à grand volume. Pour approfondir le sujet, consultez notre billet de blogue ici.

  1. Classer les entrées en parallèle (ne pas laisser entrer les mauvaises invites) : De petits classificateurs propres à chaque sujet s’exécutent simultanément pour étiqueter chaque message d’utilisateur. Nous avons constaté que les classificateurs étroitement ciblés sont sensiblement plus fiables qu’un classificateur généraliste unique. Des exemples few-shot soigneusement choisis dans l’invite peuvent aider à distinguer « Ce boss n’arrête pas de me tuer » — contexte de jeu totalement inoffensif — d’un signal de préjudice réel.

    • Sûr → Générer normalement

    • Jailbreaks → Ignorer ou détourner avec un refus conforme à la marque

    • Risques pour la sécurité ou le bien-être → Transmettre à un humain avec un contexte détaillé

  2. Classer les sorties (ne pas livrer une mauvaise réponse) : Chaque réponse candidate est vérifiée de nouveau avant sa livraison. Cela protège contre la dérive du modèle, l’empoisonnement des données RAG et les cas limites subtils des politiques, comme le contenu préjudiciable, l’exposition de renseignements personnels ou la fuite d’informations sensibles. Si une réponse est signalée, nous remplaçons celle générée par le LLM par un message sûr et conforme à la marque, ou nous la transmettons à un humain, plutôt que de livrer un contenu que nous regretterions.

  3. Assurer rapidité et abordabilité : La création d’invites sous forme de composants réutilisables permet de mettre en cache des fragments d’invites, des exemples few-shot de classificateurs et des préfixes de dialogue courants. Cette approche permet de réduire à la fois la latence et le coût de vos garde-fous.

  4. Traiter la sécurité comme une dimension du produitLes refus et les avertissements sont rédigés dans le ton approprié — ludique pour les jeux, formel pour les finances, par exemple. Lorsque l’expérience utilisateur respecte l’intention de l’utilisateur, l’acceptation des garde-fous augmente et les tentatives de jailbreak diminuent.

  5. Surveiller, mobiliser une équipe rouge et boucler la boucleLes exercices continus d’équipe rouge et les tableaux de bord de sécurité en direct aident à détecter les régressions avant qu’elles touchent les utilisateurs. Nous pouvons enseigner au modèle tout nouveau type d’attaque en fournissant des exemples few-shot ou des règles de routage supplémentaires, afin que le système devienne plus difficile à contourner au fil du temps sans compromettre la performance de l’application.

Les défis actuels de la création d’une solution de modération

Il est difficile de créer et de maintenir des garde-fous efficaces.

En pratique, cela exige une étroite collaboration entre les principales parties prenantes de l’entreprise et les développeurs afin de créer une politique bien définie. Une fois la politique définie, il faut ensuite concevoir et ajuster le système et son comportement.

L’arrivée de modèles ouverts de raisonnement axés sur la sécurité, comme gpt-oss-safeguard, pourrait résoudre certains problèmes de ce processus en offrant une base de modération de contenu plus polyvalente et prête à l’emploi.

La promesse des modèles de sécurité spécialisés

Gpt-oss-safeguard vise à résoudre certains des défis couramment associés à la création des systèmes de modération actuels. Ces petits modèles spécialisés sont ajustés pour raisonner sur une politique cible au moment de l’inférence et repérer les contenus préjudiciables ou sensibles, comme les jailbreaks, l’exposition de renseignements personnels et d’autres violations des politiques.

En intégrant le raisonnement à leur processus de classification, ils assurent une modération plus précise, plus robuste et plus difficile à contourner. En tant que variantes de sécurité spécialisées de GPT-OSS 20B et 120B, ils offrent une performance de pointe en matière de sécurité tout en exigeant très peu de configuration grâce à des définitions de politiques personnalisées.

Ce que nous avons testé

Nous avons évalué gpt-oss-safeguard 20B et 120B dans plusieurs tâches représentatives de la production : un assistant vocal en temps réel, un robot de soutien aux joueurs en jeu, un système proactif de modération de clavardage et une analyse multilingue de la toxicité — en espagnol, français, italien, portugais, russe et turc.

Nos constatations

  • Modération vocale sensible à la latence : Lors de nos essais vocaux en temps réel — imaginez une classification en direct dans une conversation où une réponse doit être analysée et triée, comme pour la modération d’un clavardage en jeu —, gpt-oss-safeguard-20B a comblé environ 80 % de l’écart d’exactitude entre GPT-OSS-20B et GPT-5-Mini (0,71 contre 0,78, comparativement à 0,45), tout en réduisant considérablement la latence.

  • Transmission du soutien aux joueurs : Dans le triage du soutien aux joueurs, gpt-oss-safeguard-20B a comblé environ 90 % de l’écart entre GPT-OSS-20b et GPT-5-Mini (0,66 contre 0,67, comparativement à 0,57). Il a également obtenu la meilleure précision macro de l’ensemble, un rappel de 88 % pour le contenu bénin et une précision de 87 % pour la détection des utilisateurs vulnérables — utile pour des transmissions prudentes et hautement fiables, sans submerger les réviseurs humains.

  • Modération à grande échelle de clavardages régis par des politiques denses : Lors de notre évaluation la plus exigeante, où un système de modération doit signaler proactivement les messages en jeu selon un document de politique dense, gpt-oss-safeguard a nettement surpassé la référence OSS, obtenant un gain relatif d’environ 35 % et traitant efficacement de longues politiques. Il s’agit d’un cas d’utilisation particulièrement sensible qui exige un rappel et une précision élevés. Un rappel trop faible laisserait passer de nombreux messages préjudiciables. Une faible précision entraînerait aussi le signalement aux modérateurs humains de nombreux messages non pertinents, détournant leur attention des cas réellement difficiles.

  • Performance multilingue : Sur un jeu de données équilibré portant sur la toxicité dans six langues, gpt-oss-safeguard a suivi de près GPT-5-Mini, généralement à 3 à 5 points de pourcentage d’écart sur l’exactitude, tandis que gpt-oss-safeguard-120B l’a légèrement devancé en espagnol. Nous avons observé des écarts légèrement plus importants dans les langues disposant de moins de ressources, comme le turc, mais la tendance générale indiquait une solide performance multilingue, avec des gains de rappel constants lors du passage de 20B à 120B.

Nous avons également observé que les modèles gpt-oss-safeguard sont très performants dans des domaines où les LLM sont traditionnellement moins efficaces en modération, notamment pour les renseignements personnels. Les modèles courants ont tendance à privilégier les formats américains de renseignements personnels et sont moins performants dans d’autres régions. Nous croyons donc que gpt-oss-safeguard contribuera à simplifier la configuration de la modération en réduisant la dépendance aux outils sur mesure servant à détecter de petites violations de politiques que les LLM généralistes ne peuvent pas traiter.

La puissance de l’ajustement fin ciblé

Nos évaluations ont donc établi que les « modèles fondamentaux de modération » comme gpt-oss-safeguard-20B et gpt-oss-safeguard-120B permettent d’aller loin, rapidement. Cependant, les modèles ajustés pour un domaine précis restent la référence lorsque les systèmes exigent les normes les plus strictes en matière de sécurité et de spécificité.

Capture d’écran illustrant la puissance de l’ajustement fin ciblé.

Pour le cas d’utilisation de la modération en jeu, nous avons ajusté un classificateur Qwen3-0.6B par affinage supervisé à partir d’environ 10 000 interventions antérieures de modérateurs et décisions liées aux politiques. Ce modèle surpasse largement tous les modèles de base que nous avons testés pour cette tâche, avec une exactitude de 57 % contre 15 % (gpt-oss-safeguard-120B, estimation fondée sur le ratio de performance de GPT-4.1-nano), soit un gain de 42 points ou d’environ 280 %. Ces résultats concordent avec les conseils d’OpenAI selon lesquels de petits classificateurs spécialisés, entraînés sur des exemples étiquetés, peuvent surpasser les modèles de protection dans des domaines spécialisés.

La conclusion est claire : lorsque les politiques sont nuancées et comportent de nombreux cas limites, un petit modèle adapté au domaine demeure la référence absolue. L’ajustement fin intègre directement votre politique et ses cas limites aux paramètres, ce qui stabilise le comportement dans le monde complexe de la production, tout en réduisant au minimum la latence et les coûts.

L’affinage supervisé n’est que l’une des nombreuses approches possibles. On peut aussi exploiter d’autres techniques d’entraînement puissantes, comme l’apprentissage par renforcement ou la distillation sur politique, afin d’optimiser davantage le comportement du modèle.

La réserve concernant l’ajustement fin

L’ajustement fin exige généralement beaucoup de données. Le jeu de données ayant servi à ajuster ce classificateur Qwen3-0.6B avait été étiqueté manuellement par des modérateurs humains et constituait donc une source de vérité fiable et de grande qualité.

Dans de nombreux projets, cet avantage lié à la richesse des données peut être absent au départ. Nous considérons donc généralement l’ajustement fin comme une optimisation pouvant intervenir plus tard dans le cycle de développement d’une solution. Une fois la forme de la solution stabilisée et des données d’utilisation réelles recueillies, les développeurs peuvent envisager un ajustement fin ciblé pour faire passer leurs solutions de modération au niveau supérieur.

Réflexions finales

Les modèles fondamentaux de modération comme gpt-oss-safeguard sont de nouveaux composants solides. Ils peuvent simplifier considérablement la conception des systèmes de modération tout en réduisant la latence des applications en temps réel. Combinez-les à de petits classificateurs sur mesure pour créer un système plus sûr et plus rapide, avec moins de composants qu’une approche fondée sur des invites et de grands modèles généralistes.

Si vous déployez ou modernisez aujourd’hui un système de modération, commencez par envisager des modèles comme gpt-oss-safeguard, mesurez leur performance, puis apportez des améliorations ciblées à l’aide de classificateurs sur mesure — fondés sur des invites ou ajustés — là où les données révèlent des lacunes.

Vous souhaitez en savoir plus? Écrivez-nous.

Auteur

Douglas Adams, Romain Bourboulou, David Jasek, Atharva Tidke