為高風險企業建立安全的聊天智能代理

建立代表品牌的聊天機械人時,安全並不足夠——它還必須真切呈現品牌本色。

摘要

  • 面向公眾的 LLM 應用程式可能令品牌面臨聲譽及財務風險。

  • 我們採用多層分類篩選器,減少 LLM 越獄及其他非預期 LLM 行為所造成的危害。

  • 我們已將這套方法應用於一個每日處理 40,000 則訊息(並持續增加)的大規模正式環境應用程式。

簡介

過去一年,我們與一家領先的遊戲開發商合作,部署了一款生成式 AI 聊天機械人,每日處理來自玩家群體(包括兒童)的約 40,000 則訊息。兼顧速度、準確度、安全與趣味至關重要:

建立代表品牌的聊天機械人時,安全並不足夠——它還必須真切呈現品牌本色。

對遊戲公司而言,這代表要將安全、趣味和令用戶投入的體驗融為一體,對年輕受眾尤其如此。

支撐現代生成式 AI 應用程式的 LLM 非常靈活,因此能廣泛應對不同問題,但其限制亦相對不足。這代表它們往往可能偏離既定方向,傳回各式各樣的文字,其中部分內容可能並不適當。

讓公眾直接使用 LLM,必然會出現非預期行為;若沒有適當緩解措施,可能造成以下風險:

現實風險一瞥……

非預期使用 LLM 所引發的新聞頭條:

這些事件突顯,在生成式 AI 系統中建立並持續維護安全性絕非可有可無。涉及年幼兒童時尤其如此。單靠免責聲明並不足夠,必須設置穩健的防護機制,確保內容恰當。

我們的方法:多層分類與提示詞快取

與我們為客戶建立的 RAG(檢索增強生成)系統類似,我們運用多個 AI 元件,在維持高效能的同時降低越獄風險。

說明我們方法的圖表:多層分類與提示詞快取。

我們系統的簡化架構圖

為確保系統安全,我們會以 LLM 分類器檢查輸入及輸出:

  1. 輸入分類(同步執行)

  • 我們結合 Pydantic 綱要與 LLM 結構化輸出內容,為用戶查詢加上標籤(例如 SAFE、SUSPICIOUS、CHILD_HARM_RISK、VIOLENT 等)。其中亦包括用於識別越獄或不允許行為的標記。

  • 針對個別主題使用多個分類器,表現遠勝單一大型「包羅萬有」分類器。

  • 大量少範例對確保分類器能區分「我不斷被這個角色殺死」(指遊戲內容)與「我的父母正在傷害我」(顯示兒童受傷害風險)至關重要。

  • 我們與客戶及其專責信任與安全團隊緊密合作,確保分類器能反映他們在現實情況下判斷高風險訊息的方式。

說明我們方法的圖表:多層分類與提示詞快取。

  1. 回應生成

  • 如果輸入被判定為安全,主要 LLM 便會生成回應。

  • 否則,系統可忽略訊息(如屬越獄),或交由人員處理(如查詢觸發安全問題標記)。

  1. 輸出分類

  • 模型的回應在離開應用程式並最終送出前,會先經過分類。

  • 部分回應可能運用 RAG 技術並取材自網上擷取的資料,因此這個步驟可防範資料毒化。

  • 如果回應包含不允許的內容,系統便會介入,並以一般訊息取代。實際上,我們甚少遇到這種情況,但這是一層審慎的額外保障,確保智能代理的行為始終恰當。

為維持速度及成本效益:

  • 我們會儲存常用提示詞、部分對話及一組精選的少範例。

  • 透過快取,我們毋須每次重新建立上下文,便能快速且低成本地套用 LLM 分類器。

說明我們方法的圖表:多層分類與提示詞快取。

展望未來:憲法式分類器

Anthropic 最近一項研究介紹了「憲法式分類器」:這套系統依靠根據「憲法式」規則訓練的額外分類器,偵測惡意或不安全的要求。研究報告指出:

  • 面對數千小時的人工作業紅隊演練,仍展現高度穩健性。

  • 過度拒絕率極低,運算開銷適中。

我們預期,這些憲法式方法日後可補足甚至取代傳統分類層,為不斷演變的越獄手法提供更全面的防禦。

總結:我們汲取的經驗

  1. 並行的輕量篩選器

分類層可阻止惡意查詢抵達生成核心,並確保不會送出品質欠佳的輸出。

  1. 用戶體驗至關重要

採用有趣、以遊戲世界觀為本的警告及輕鬆活潑的拒絕方式,能令用戶更願意接受系統限制。

  1. 切勿在測試及監察方面取巧

定期進行紅隊演練,並頻密監察玩家行為,有助在漏洞廣為玩家所知前將其找出。其後可將這些漏洞回饋至少範例分類器提示詞,防止日後再被利用(目前這是人手程序,但可以自動化)。

為未來建立安全又具吸引力的生成式 AI 系統

無論是遊戲公司、銀行還是政府部門,只要準備大規模推行客戶服務聊天機械人,就必須同時兼顧用戶體驗設計及可信度。

我們為有以下要求的機構及品牌建立面向客戶的解決方案:

  1. 安全至上——聊天機械人既要為用戶提供價值,亦須嚴格保障用戶免受有害內容影響

  2. 保障聲譽——我們設計多層保護,即使用戶試圖令系統超越限制,亦能維護品牌聲譽

  3. 法規限制選擇——我們緊貼最新合規指引,讓您擴展解決方案時,毋須擔心應用程式遭到越獄

Author

Andrew Liubinas