OpenAI 的 gpt-oss-safeguard 模型对 AI 安全意味着什么

对 OpenAI gpt-oss-safeguard 模型的早期评估显示了专用安全模型可在哪些方面增强生产环境中的 AI 系统。

过去两年中,我们构建的解决方案已安全扩展至数百万用户。这项工作的关键之一,是设计快速、准确的审核系统。有效的审核机制能让企业放心部署前沿 AI 解决方案,在不当生成内容造成问题之前将其拦截,从而保护最终用户免受伤害,并维护品牌安全。

最近,OpenAI 发布了 GPT-OSS-Safeguard 模型:这是今年早些时候推出的 20B 和 120B OSS 模型的微调版本。这些模型可在推理时直接解读用户的政策,为内容审核提供灵活而强大的方法。这些模型目前处于研究预览阶段,今后无疑还会不断改进。

在此次发布之前,我们与 OpenAI 开展了合作,通过实际场景评估为模型开发提供参考。本文将分享此次合作带来的见解,并探讨这些进展对生产环境中 AI 系统审核工作的未来意味着什么。

如今,生产环境中的审核机制如何运作?

如今,审核解决方案通常以多层防护的形式部署在应用外围。我们在许多面向公众的大规模部署中都采用了这种模式。如需深入了解,可以在此阅读我们的相关博客文章。

  1. 并行分类输入(不让恶意提示进入系统):多个小型主题专用分类器会同时运行,为每条用户消息添加标签。我们发现,聚焦特定领域的分类器明显比单一的全能型分类器更可靠。在提示中精心选择少样本示例,有助于区分“我总是被这个头目打死”(游戏语境,完全无害)与现实世界中的伤害信号。

    • 安全 → 正常生成

    • 越狱 → 忽略,或以符合品牌调性的拒绝话术化解

    • 安全或身心健康风险 → 附带丰富上下文,升级至人工处理

  2. 对输出进行分类(不交付不当回答):每个候选回复都会在交付前再次接受筛查。这样可以防范模型漂移、RAG 数据投毒,以及有害内容、个人身份信息泄露或敏感信息外泄等细微的政策边缘情况。如果回答被标记,我们不会交付可能令人后悔的内容,而是用安全且符合品牌调性的消息替换 LLM 生成的回答,或升级至人工处理。

  3. 兼顾速度与成本:将提示设计为可复用的构建模块,即可缓存提示片段、分类器的少样本示例和常用对话前缀。这种方法可以同时降低防护机制的延迟和成本。

  4. 将安全视为产品体验的一部分拒绝和警告信息应符合产品的语言风格(例如游戏采用活泼语气,金融服务采用正式语气)。当用户体验尊重用户意图时,用户对防护机制的接受度会提高,越狱尝试也会减少。

  5. 持续监控、开展红队测试并形成闭环持续的红队测试和实时安全仪表板有助于在性能退化影响用户之前发现问题。我们可以添加少样本示例和/或路由规则,让模型掌握任何新型攻击模式,使系统在不影响应用性能的前提下越来越难以攻破。

当今构建审核解决方案面临的挑战

构建并维护有效的防护机制并非易事。

在实践中,需要关键业务利益相关方与开发者密切协作,制定定义明确的政策。政策确定后,还必须构建和调优系统设计及系统行为。

gpt-oss-safeguard 等开放式安全推理模型的出现,有望解决这一过程中的部分难点,为内容审核提供更易于直接使用且用途广泛的基础。

专用安全模型的潜力

Gpt-oss-safeguard 旨在解决当前构建审核系统时普遍面临的一些挑战。这些小型专用模型经过微调,可在推理时依据目标政策进行推理,查找越狱、个人身份信息泄露及其他违反政策的有害或敏感内容。

通过将推理纳入分类流程,它们能提供更准确、更稳健且更难绕过的审核机制。作为 GPT-OSS 20B 和 120B 的专用安全版本,它们只需定义自定义政策,几乎无需额外设置,即可实现最先进的安全性能。

我们的测试内容

我们针对多项贴近生产环境的任务评估了 gpt-oss-safeguard 20B 和 120B,包括实时语音助手、游戏内玩家支持机器人、主动式聊天审核系统,以及多语言有害内容扫描(西班牙语、法语、意大利语、葡萄牙语、俄语和土耳其语)。

我们的发现

  • 对延迟敏感的语音审核:在实时语音测试中(即在对话过程中进行实时分类,需要分析回复并确定处理优先级,例如游戏聊天审核),gpt-oss-safeguard-20B 将 GPT-OSS-20B 与 GPT-5-Mini 之间的准确率差距缩小了约 80%(从 0.45 提升至 0.71,而后者为 0.78),同时大幅降低了运行延迟。

  • 玩家支持升级:在玩家支持分流中,gpt-oss-safeguard-20B 将 GPT-OSS-20b 与 GPT-5-Mini 之间的差距缩小了约 90%(从 0.57 提升至 0.66,而后者为 0.67)。它还取得了测试组中最佳的宏平均精确率,对良性内容的召回率达到 88%,识别脆弱用户的精确率达到 87%。如果您希望在不让人工审核员被大量任务淹没的前提下实现保守且高度可信的升级处理,这些指标非常实用。

  • 大规模执行复杂政策的聊天审核:在要求最高的评估中,审核系统需要依据内容繁多的政策文档主动标记游戏内消息。gpt-oss-safeguard 明显优于 OSS 基线,取得约 35% 的相对提升,并能有效处理篇幅较长的政策。这是一个尤其敏感的使用场景,对召回率和精确率均有很高要求。召回率过低会导致许多有害消息被漏检。精确率过低则会将大量无关消息标记并交由人工审核,分散审核员的注意力,使他们难以专注于真正棘手的案例。

  • 多语言性能:在涵盖六种语言的均衡有害内容数据集上,gpt-oss-safeguard 的表现与 GPT-5-Mini 十分接近,准确率差距通常在 3 至 5 个百分点以内;在西班牙语测试中,gpt-oss-safeguard-120B 略胜一筹。我们发现,在土耳其语等低资源语言上,性能差距略大;但整体而言,其跨语言表现稳定,从 20B 升级至 120B 后,召回率也得到了一致提升。

我们还发现,gpt-oss-safeguard 模型在 LLM 传统上不擅长的审核领域表现出色,例如个人身份信息数据。主流模型往往更偏向识别美国格式的个人身份信息,对其他地区相关数据的识别能力较弱。因此,我们认为 gpt-oss-safeguard 有助于简化审核系统的搭建:它可以识别通用 LLM 无法处理的细微违规行为,从而减少对定制工具的依赖。

定向微调的强大能力

我们的评估表明,gpt-oss-safeguard-20B 和 gpt-oss-safeguard-120B 等“基础审核模型”能够让您快速取得显著成效。不过,当系统对安全性和针对性有最高要求时,特定领域的微调模型仍然代表着最高水准。

展示定向微调强大能力的屏幕截图。

针对游戏内审核场景,我们使用约 1 万条历史审核操作及政策判定结果,通过监督微调训练了一个 Qwen3-0.6B 分类器。该模型在这项任务上的表现大幅超越了我们测试的所有基础模型,准确率达到 57%,而后者为 15%(gpt-oss-safeguard-120B,根据 GPT-4.1-nano 的性能比率估算),提升 42 个百分点,增幅约 280%。这些结果与 OpenAI 的指导意见一致:对于专业领域,基于标注样本训练的小型专用分类器可以胜过安全防护模型。

结论很明确:当政策细致复杂且存在大量边缘情况时,经过领域调优的小型模型仍是黄金标准。微调过程会将您的政策和边缘情况直接融入模型参数,使模型面对复杂的生产环境时表现更加稳定,同时将延迟和成本降至极低水平。

监督微调只是实现这一目标的多种方法之一。还可以利用强化学习或同策略蒸馏等其他强大的训练技术,进一步优化模型行为。

微调的注意事项

微调通常需要大量数据。用于微调这个 Qwen3-0.6B 分类器的数据集由人工审核员手动标注,因此是一套干净、可靠的黄金标准数据。

许多项目在启动之初可能并不具备这种丰富的数据优势。因此,我们通常将微调视为解决方案开发周期后期可以实施的一项优化。当解决方案的整体架构趋于稳定,并收集到一定量的真实用户数据后,开发者便可通过定向微调,让审核解决方案更上一层楼。

结语

gpt-oss-safeguard 等基础审核模型是强大的新型构建模块。它们有望显著简化审核系统的设计,同时降低实时应用的延迟。将它们与小型定制分类器结合,便可构建更安全、更快速的系统,而且相比采用大型通用模型、基于提示的方法,所需的组件更少。

如果您正在搭建或升级审核系统,不妨先从 gpt-oss-safeguard 等模型入手,评估其性能,再针对数据暴露出的不足,通过定制分类器(基于提示或经过微调)进行定向增强。

想了解更多?欢迎给我们留言

作者

Douglas Adams、Romain Bourboulou、David Jasek、Atharva Tidke