過去兩年,我們建立的解決方案已安全擴展至服務數百萬名用戶。這項工作的關鍵之一,是設計快速而準確的內容審查系統。有效的內容審查讓企業能放心部署尖端 AI 解決方案,在不當生成內容造成問題前加以攔截,保障終端用戶免受傷害,並維護品牌安全。
最近,OpenAI 發佈了 GPT-OSS-Safeguard 模型:這是今年較早前推出的 20B 和 120B OSS 模型之微調版本。這些模型可在推理時直接解讀用戶政策,為內容審查提供靈活而強大的方法。這些模型目前處於研究預覽階段,日後無疑會持續改進。
我們在發佈前與 OpenAI 合作,進行實際環境評估,為模型開發提供參考。本文將分享這次合作所得的見解,並探討這些進展對生產環境 AI 系統內容審查的未來有何意義。
現今的內容審查方案通常是在應用程式外圍設置多重保護。我們在面向公眾的大規模部署中經常採用這種模式。如要深入了解,可按此參閱我們的相關網誌文章。
並行分類輸入(阻截不當提示詞):多個小型主題專用分類器會同步運作,為每則用戶訊息加上標籤。我們發現,專注於特定範疇的分類器,可靠程度明顯高於單一全能分類器。在提示詞中加入精心挑選的少範例,有助區分「我老是被這個頭目殺死」(遊戲情境,完全無害)與現實世界的傷害訊號。
安全 → 正常生成
越獄 → 忽略,或以符合品牌語調的拒絕訊息轉移話題
安全或身心健康風險 → 附上充分背景資料,轉交人員處理
分類輸出(不要發送不當答案):每個候選回應在傳送前都會再次篩查。這可防範模型漂移、RAG 數據投毒,以及有害內容、個人識別資料外洩或敏感資料洩漏等細微的政策邊緣案例。如回應被標記,我們不會發送可能令人後悔的內容,而會以安全且符合品牌形象的訊息取代 LLM 生成的答案,或轉交人員處理。
兼顧速度與成本效益:把提示詞建構成可重用的模組,便可快取提示詞片段、分類器的少範例及常用對話前綴。這種方法可同時降低防護機制的延遲和成本。
把安全視為產品體驗的一環拒絕和警告訊息應符合品牌語調(例如遊戲採用輕鬆語氣,金融服務則採用正式語氣)。當用戶體驗尊重用戶意圖時,用戶會更願意接受防護機制,越獄嘗試亦會減少。
監察、進行紅隊演練並形成閉環持續進行紅隊演練並使用實時安全資訊主頁,有助在效能倒退影響用戶前及早發現問題。我們可加入額外的少範例及/或路由規則,讓模型學會識別任何新型攻擊模式,令系統在不影響應用程式效能的情況下,日益難以被攻破。
建立並維護有效的防護機制並不容易。
實際上,這需要主要業務持份者與開發人員緊密合作,制定明確的政策。政策確立後,還須建立並調校系統設計和行為。
gpt-oss-safeguard 等開放安全推理模型的出現,有望解決這個流程中的部分難題,為內容審查提供更容易直接使用、用途更廣泛的基礎。
Gpt-oss-safeguard 旨在解決現今建立內容審查系統時常見的部分挑戰。這些小型專用模型經過微調,可在推理時依據目標政策進行推理,識別越獄、個人識別資料外洩及其他違反政策的有害或敏感內容。
它們把推理納入分類流程,令內容審查更準確、更穩健,也更難繞過。作為 GPT-OSS 20B 和 120B 的專用安全版本,它們透過自訂政策定義,以極少的設定工作便可實現頂尖安全表現。
我們在多項貼近生產環境的任務中評估 gpt-oss-safeguard 20B 和 120B,包括實時語音助理、遊戲內玩家支援機械人、主動式聊天內容審查系統,以及多語言有害內容掃描(西班牙文、法文、意大利文、葡萄牙文、俄文和土耳其文)。
對延遲敏感的語音內容審查:在實時語音測試中(即在對話期間即時分類,例如遊戲聊天內容審查,系統須分析回應並判斷處理優先次序),gpt-oss-safeguard-20B 把 GPT-OSS-20B 與 GPT-5-Mini 之間的準確度差距收窄約 80%(由 0.45 提升至 0.71,而後者為 0.78),同時大幅降低運行延遲。
玩家支援升級處理:在玩家支援分流中,gpt-oss-safeguard-20B 把 GPT-OSS-20b 與 GPT-5-Mini 之間的差距收窄約 90%(由 0.57 提升至 0.66,而後者為 0.67)。它亦錄得測試組中最佳的宏觀精確率、對良性內容達 88% 召回率,以及識別弱勢用戶達 87% 精確率;如要在不令人工審查人員不勝負荷的情況下,採取審慎且高度可信的升級處理,這些表現尤其實用。
大規模執行政策密集的聊天內容審查:在要求最高的評估中,內容審查系統須根據詳盡的政策文件,主動標記遊戲內訊息。gpt-oss-safeguard 明顯優於 OSS 基準,取得約 35% 的相對升幅,並能有效處理篇幅較長的政策。這項用途尤其敏感,對召回率和精確率都有很高要求。召回率太低,便會遺漏大量有害訊息。精確率偏低則會把大量無關訊息標記並交由內容審查人員處理,分散他們對真正棘手個案的注意力。
多語言表現:在涵蓋六種語言的均衡有害內容數據集上,gpt-oss-safeguard 的表現緊貼 GPT-5-Mini,準確度通常只相差 3 至 5 個百分點,而 gpt-oss-safeguard-120B 在西班牙文方面更略勝一籌。在土耳其文等資源較少的語言中,我們觀察到差距稍大;但整體而言,其跨語言表現穩健,而且從 20B 升級至 120B 時,召回率均有一致提升。
我們亦觀察到,gpt-oss-safeguard 模型在 LLM 傳統上較不擅長的內容審查範疇表現出色,例如個人識別資料。主流模型往往較偏向識別美國格式的個人識別資料,在其他地區的表現則較弱。因此,我們相信 gpt-oss-safeguard 有助簡化內容審查設定,減少依賴訂製工具來識別一般 LLM 無法處理的輕微違規情況。
我們的評估證實,gpt-oss-safeguard-20B 和 gpt-oss-safeguard-120B 等「基礎內容審查模型」,能讓你迅速取得顯著成效。然而,當系統對安全性和精確度有最高要求時,特定領域的微調模型仍是業界標準。


針對遊戲內內容審查用途,我們以約一萬項過往審查人員的處置和政策判定結果進行監督微調,微調出一個 Qwen3-0.6B 分類器。此模型在這項任務上的表現大幅超越我們測試的所有基礎模型,準確率達 57%,相對於 15%(gpt-oss-safeguard-120B,按 GPT-4.1-nano 的表現比例估算),提升 42 個百分點,增幅約 280%。這些結果與 OpenAI 的指引一致:以標註範例訓練的小型專用分類器,在專門領域的表現可優於防護模型。
結論十分明確:當政策細緻複雜,並涉及大量邊緣案例時,經特定領域調校的小型模型仍是黃金標準。微調過程會把政策和邊緣案例直接融入參數,令模型面對複雜多變的實際生產環境時表現更穩定,同時只需極低延遲和成本。
監督微調只是其中一種可行方法。亦可運用強化學習或同策略蒸餾等其他強大訓練技術,進一步優化模型行為。
微調通常需要大量數據。用於微調這個 Qwen3-0.6B 分類器的數據集,由內容審查人員親自標註,因此是乾淨可靠的黃金標準資料來源。
許多項目在起步時未必具備這種豐富的數據優勢。因此,我們通常把微調視為解決方案開發週期較後階段才進行的優化。當解決方案的整體形態趨於穩定,並累積了一些真實用戶數據後,開發人員便可考慮採用針對性微調,讓內容審查方案更上一層樓。
gpt-oss-safeguard 等基礎內容審查模型,是強大的新型構建模組。它們有望大幅簡化內容審查系統的設計,同時降低實時應用的延遲。配合小型訂製分類器,便可建立更安全、更快速的系統,而且比使用大型通用模型的提示詞方案所需的組件更少。
如果你現正建立或升級內容審查系統,可考慮先採用 gpt-oss-safeguard 等模型,量度其表現,再根據數據顯示的不足之處,加入訂製分類器(以提示詞驅動或經微調)作針對性改進。
想了解更多?歡迎聯絡我們。