面向大眾的 LLM 應用程式可能使品牌承受聲譽與財務風險。
我們運用多層分類篩選器,降低 LLM 越獄及其他非預期 LLM 行為造成的危害。
我們已將這套方法應用於高流量的正式環境應用程式,每日處理 40,000 則以上且持續增加的訊息。
過去一年來,我們與一家頂尖遊戲開發商合作,部署一款生成式 AI 聊天機器人,每天接收玩家(包括兒童)的約 40,000 則訊息。兼顧速度、準確性、安全與趣味至關重要:
打造代表品牌的聊天機器人時,安全並不足夠;它還必須真實展現品牌的獨特語調。
對遊戲公司而言,這代表必須兼顧安全、趣味與使用者的興奮感,尤其是面對年輕受眾時。
現代生成式 AI 應用程式背後的 LLM 極具彈性,因此能廣泛適用於各種問題,但受到的約束也不夠充分。這表示它們經常可能偏離正軌,回傳各式各樣的文字,其中部分內容可能並不恰當。
直接向大眾開放 LLM,勢必會出現非預期行為;若沒有適當的緩解措施,可能面臨以下風險:
「越獄」:使用者蓄意操控聊天機器人,使其產生有害或禁止的內容(有個有趣的小知識:任何人都能造訪這個網站,透過趣味遊戲探索如何讓 LLM 越獄……);或
無意間提供令人不適、冒犯或危險的內容。在許多情況下,這可能危及使用者的身心健康,或導致應用程式供應商蒙受財務或品牌損失。
LLM 非預期用途登上新聞頭條:
這些事件凸顯出,在生成式 AI 系統中建立並持續維護安全性絕非可有可無。涉及年幼兒童時尤其如此。不能只靠免責聲明;要確保內容恰當,完善的防護機制不可或缺。
如同我們為客戶打造的 RAG(檢索增強生成)系統,我們運用多個 AI 元件降低越獄風險,同時維持高效能。


我們系統的簡化架構圖
為確保系統安全,我們會使用 LLM 分類器檢查輸入與輸出:
輸入分類(同步執行)
我們結合 Pydantic 綱要與 LLM 結構化輸出,為使用者查詢加上標籤,例如 SAFE、SUSPICIOUS、CHILD_HARM_RISK、VIOLENT 等。其中也包括用來識別越獄或禁止行為的旗標。
針對不同主題使用多個分類器,其成效遠優於單一大型的「包山包海」分類器。
大量少樣本範例至關重要,能確保分類器區分「我一直被這個角色殺死」(指遊戲情節)與「我的父母正在傷害我」(表示兒童受害風險)。
我們與客戶及其專業信任與安全團隊密切合作,確保分類器能反映他們在現實中判斷高風險訊息的方式。


回應生成
若輸入經判定為安全,主要 LLM 就會生成回應。
否則,系統可以忽略訊息(若為越獄),或交由真人處理(若查詢觸發安全問題旗標)。
輸出分類
模型回應離開應用程式並正式送出前,我們會先加以分類。
由於部分回應可能運用 RAG 技術,引用從網際網路擷取的資料,這個步驟可防範資料投毒。
如果回應含有禁止的內容,系統就會介入,改以一般訊息取代。實務上,這種情況極少發生,但這層保守的額外防護能確保智慧體的行為始終恰當。
為兼顧速度與成本效益:
我們會儲存常用提示詞、部分對話,以及一組精心挑選的少樣本範例。
這種快取機制讓我們無須每次重新建立情境,即可快速且低成本地套用 LLM 分類器。


Anthropic 最近的一項研究介紹了「憲法分類器」:這套系統使用依據「憲法」規則訓練的額外分類器,偵測惡意或不安全的要求。研究結果顯示:
面對數千小時的人工紅隊演練,展現高度穩健性。
過度拒絕率極低,運算負擔適中。
未來,這類憲法式方法可望補足甚至取代傳統分類層,更全面地防禦持續演變的越獄手法。
平行執行的輕量篩選器
分類層能阻止惡意查詢觸及生成核心,並確保不良輸出絕不會送達使用者。
使用者體驗至關重要
採用有趣、符合世界觀的警告與活潑的拒絕方式,能讓使用者更願意接受系統限制。
測試與監控絕不能偷工減料
定期進行紅隊演練並頻繁監控玩家行為,有助於在漏洞廣為玩家所知前及早發現。接著可將這些漏洞回饋至少樣本分類器提示詞,防止日後再遭利用(目前仍為手動流程,但可望自動化)。
無論是遊戲公司、銀行或政府部門,只要要大規模導入客服聊天機器人,就必須同時兼顧使用者體驗設計與可信度。
我們為具備以下需求的組織與品牌打造面向客戶的解決方案:
安全至上——聊天機器人不僅為使用者創造價值,也嚴格保護他們免受有害內容影響
維護聲譽——我們設計多層防護,即使使用者試圖突破系統極限,也能確保品牌聲譽不受損害
法規限制可行方案——我們隨時掌握最新合規準則,讓您能放心擴展解決方案,無須擔心應用程式遭到越獄