OpenAI 的 gpt-oss-safeguard 模型對 AI 安全有何意義

OpenAI gpt-oss-safeguard 模型的初步評估,顯示專用安全模型能在哪些方面強化正式環境 AI 系統。

過去兩年來,我們打造的解決方案已安全擴展至數百萬名使用者。其中一項關鍵工作,就是設計快速且準確的審核系統。有效的審核機制能讓企業放心部署尖端 AI 解決方案,在不良生成內容造成問題前加以攔截,保護終端使用者免受傷害並維護品牌安全。

最近,OpenAI 發布了 GPT-OSS-Safeguard 模型:這是今年稍早推出的 20B 與 120B OSS 模型之微調版本。這些模型能在推論時直接解讀使用者的政策,提供靈活且強大的內容審核方法。這些模型目前處於研究預覽階段,未來無疑會持續改進。

在本次發布前,我們曾與 OpenAI 合作進行實際環境評估,為模型開發提供參考。本文將分享這次合作的心得,並探討這些進展對正式環境 AI 系統的審核未來有何意義。

現今正式環境中的審核機制如何運作?

現今的審核解決方案通常採用多層防護,環繞在應用程式外圍。我們經常將此模式用於高流量、面向大眾的部署。如需深入瞭解,可參閱我們這篇相關文章。

  1. 並行分類輸入內容(別讓惡意提示詞進入):由小型主題專用分類器同時執行,為每則使用者訊息加上標籤。我們發現,範圍聚焦的分類器明顯比單一全能型分類器更可靠。在提示詞中精心挑選少樣本範例,有助於區分「我一直被這個頭目殺掉」(遊戲情境,完全無害)與真實世界中的傷害訊號。

    • 安全 → 正常生成

    • 越獄 → 忽略,或以符合品牌調性的拒絕回應避開

    • 安全或身心健康風險 → 連同充分的情境資訊轉交人工處理

  2. 分類輸出內容(別送出不良答案):每個候選回應都會在送出前再次篩查。這可防範模型漂移、RAG 資料投毒,以及有害內容、個人識別資訊(PII)暴露或敏感資訊外洩等細微的政策邊界案例。若內容遭標記,我們不會送出日後可能後悔的內容,而是將 LLM 生成的答案替換為安全且符合品牌調性的訊息,或轉交人工處理。

  3. 兼顧速度與成本:將提示詞建構成可重複使用的元件,便能快取提示詞片段、分類器的少樣本範例,以及常見的對話前綴。這種方法可同時降低防護機制的延遲與成本。

  4. 將安全視為產品體驗的一環拒絕與警告訊息會採用符合產品調性的語氣(例如遊戲採輕鬆活潑的語氣,金融則採正式語氣)。當使用者體驗尊重使用者的意圖時,防護機制的接受度會提高,越獄嘗試則會減少。

  5. 監控、紅隊演練並形成閉環持續進行紅隊演練並使用即時安全儀表板,有助於在效能退步影響使用者前及早發現。我們可以提供額外的少樣本範例及/或路由規則,讓模型學會辨識任何新型攻擊模式,使系統日益難以攻破,同時不影響應用程式效能。

現今建構審核解決方案所面臨的挑戰

建構並維護有效的防護機制並不容易。

實務上,主要業務利害關係人與開發人員必須密切合作,才能制定明確的政策。政策確立後,還必須建構並調校系統設計及行為。

gpt-oss-safeguard 等開放式安全推理模型的問世,有望解決此流程中的部分痛點,為內容審核提供更容易上手且用途靈活的基礎。

專用安全模型的潛力

Gpt-oss-safeguard 旨在解決現今建構審核系統時常見的部分挑戰。這些小型專用模型經過微調,能在推論時針對目標政策進行推理,找出越獄、個人識別資訊(PII)暴露及其他違反政策的有害或敏感內容。

藉由將推理納入分類流程,它們能提供更準確、更穩健且更難規避的審核機制。作為 GPT-OSS 20B 與 120B 的專用安全版本,它們只需定義自訂政策,幾乎不必額外設定,便能實現最先進的安全效能。

我們測試了什麼

我們針對多項貼近正式環境的任務評估 gpt-oss-safeguard 20B 與 120B,包括即時語音助理、遊戲內玩家支援機器人、主動式聊天審核系統,以及多語言毒性內容掃描(西班牙文、法文、義大利文、葡萄牙文、俄文和土耳其文)。

我們的發現

  • 對延遲敏感的語音審核:在即時語音測試中(例如在對話中即時分類,必須分析回應並判定處理優先順序,如遊戲聊天審核),gpt-oss-safeguard-20B 將 GPT-OSS-20B 與 GPT-5-Mini 之間的準確率差距縮小約 80%(從 0.45 提升至 0.71,對比 0.78),同時大幅降低延遲。

  • 玩家支援升級處理:在玩家支援分流中,gpt-oss-safeguard-20B 將 GPT-OSS-20b 與 GPT-5-Mini 之間的差距縮小約 90%(從 0.57 提升至 0.66,對比 0.67)。它的總體精確率也居同組之冠,對良性內容的召回率達 88%,辨識脆弱使用者的精確率達 87%——如果你希望採取保守且高度可信的升級處理方式,又不想讓人工審核人員被大量案件淹沒,這些特性相當實用。

  • 大規模執行政策密集的聊天審核:在要求最高的評估中,審核系統必須依據內容繁複的政策文件,主動標記遊戲內訊息;gpt-oss-safeguard 明顯勝過 OSS 基準模型,相對提升約 35%,也能有效處理篇幅較長的政策。這項使用案例格外敏感,對召回率與精確率的要求都很高。召回率太低,就會漏掉許多有害訊息。而精確率偏低,則會將許多不相關的訊息標記給人工審核人員,分散他們處理真正棘手案例的注意力。

  • 多語言效能:在涵蓋六種語言的均衡毒性內容資料集上,gpt-oss-safeguard 的表現與 GPT-5-Mini 相近,準確率通常僅相差 3 至 5 個百分點;其中 gpt-oss-safeguard-120B 在西班牙文上略勝一籌。我們在土耳其文等資源較少的語言中觀察到稍大的差距,但整體而言,其跨語言效能相當穩健;從 20B 升級至 120B 時,召回率也持續提升。

我們也觀察到,gpt-oss-safeguard 模型在 LLM 傳統上較不擅長的審核領域表現強勁,例如個人識別資訊(PII)資料。主流模型往往偏向辨識美國格式的 PII 資料,在其他地區的表現則較弱。因此,我們認為 gpt-oss-safeguard 有助於簡化審核機制,減少對客製化工具的依賴;這些工具原本用於偵測通用 LLM 無法處理的細微政策違規。

針對性微調的威力

我們的評估證實,gpt-oss-safeguard-20B 和 gpt-oss-safeguard-120B 等「基礎審核模型」能讓你快速取得顯著成效。然而,當系統要求最高水準的安全性與明確針對性時,特定領域的微調模型仍是業界標竿。

展示針對性微調威力的螢幕截圖。

在遊戲內審核的使用案例中,我們運用約 1 萬筆過往審核人員的處置與政策判定結果,透過監督微調來微調 Qwen3-0.6B 分類器。在這項任務中,此模型大幅勝過我們測試的所有基礎模型,準確率達 57%,相較之下 gpt-oss-safeguard-120B 為 15%(依 GPT-4.1-nano 的效能比例估算),提高 42 個百分點,增幅約 280%。這些結果與 OpenAI 的指引一致:以標記範例訓練的小型專用分類器,在專業領域的表現可勝過防護模型。

結論很明確:當政策細緻複雜且有許多邊界案例時,經特定領域調校的小型模型仍是黃金標準。微調會將政策與邊界案例直接融入模型參數,使其面對複雜的實際生產環境時表現更穩定,同時將延遲與成本降到極低。

監督微調只是可行方法之一。也可以運用強化學習或同策略蒸餾等其他強大的訓練技術,進一步最佳化模型行為。

微調的注意事項

微調通常需要大量資料。用於微調這個 Qwen3-0.6B 分類器的資料集,是由人工審核人員手動標記,因此是一套乾淨、可靠的標準答案資料。

許多專案在起步時未必具備如此豐富的資料優勢。因此,我們通常將微調視為解決方案開發週期後期才進行的最佳化工作。待解決方案大致定型並收集到一些真實使用者資料後,開發人員便可著手進行針對性微調,讓審核解決方案更上一層樓。

結語

gpt-oss-safeguard 這類基礎審核模型是強大的新型建構元件。它們有望大幅簡化審核系統的設計,同時降低即時應用的延遲。將其搭配小型客製化分類器,便能打造更安全、更快速的系統;與使用大型通用模型、以提示詞為基礎的方法相比,所需的活動元件也更少。

如果你目前正建置或升級審核機制,可考慮先從 gpt-oss-safeguard 等模型著手,評估其效能,再針對資料顯示的缺口,以客製化分類器(採提示詞或微調)進行強化。

想進一步瞭解嗎?歡迎傳訊息給我們

作者

Douglas Adams、Romain Bourboulou、David Jasek和Atharva Tidke