面向公众的大语言模型(LLM)应用可能给品牌带来声誉和财务风险。
我们采用分层分类过滤器,降低LLM越狱及其他非预期LLM行为造成的危害。
我们已将这一方法用于一个大规模生产应用,该应用每天处理40,000条消息,而且数量仍在增长。
过去一年里,我们与一家领先的游戏开发商合作,部署了一款生成式AI聊天机器人,每天为包括儿童在内的玩家群体处理约40,000条消息。兼顾速度、准确性、安全性和趣味性至关重要:
打造代表品牌的聊天机器人时,仅仅确保安全还不够——它还需要原汁原味地传达你的品牌个性。
对游戏公司而言,这意味着要兼顾安全性、趣味性和用户的兴奋感——尤其是在面对低龄用户时。
现代生成式AI应用所依赖的LLM非常灵活,因此能广泛适用于许多问题,但同时也缺乏足够约束。这意味着它们经常可能“偏离正轨”,生成各种各样的文本,其中有些内容可能并不适宜。
将LLM直接开放给公众必然会产生意外行为;如果没有适当的缓解措施,可能面临以下风险:
“越狱”:用户故意操纵聊天机器人,使其生成有害或不允许的内容(分享一个有趣的小知识:任何人都可以访问这个网站,通过一款趣味游戏探索LLM越狱……);或者
无意中提供令人不适、冒犯性或危险的内容。很多情况下,这可能危及用户福祉,或给应用提供商造成财务损失和品牌损害。
LLM非预期使用引发的新闻头条:
这些事件凸显出,在生成式AI系统中构建并持续维护安全性绝非可有可无。涉及低龄儿童时尤其如此:不能只依赖免责声明,必须设置强有力的防护机制,确保内容适宜。
与我们为客户构建的RAG(检索增强生成)系统类似,我们利用多个AI组件降低越狱风险,同时保持高性能。


系统的简化架构图
为确保系统安全,我们使用LLM分类器对输入和输出进行分类:
输入分类(并行运行)
我们结合使用Pydantic架构和LLM结构化输出,为用户查询添加标签(例如SAFE、SUSPICIOUS、CHILD_HARM_RISK、VIOLENT等)。其中还包括用于识别越狱或违规行为的标记。
与一个包罗万象的超大型分类器相比,针对各个主题使用多个分类器的效果明显更好。
大量少样本示例至关重要,可以确保分类器区分“我一直被这个角色杀死”(指游戏情境)和“我的父母正在伤害我”(表明存在儿童受伤害风险)。
通过与客户及其专业的信任与安全团队密切合作,我们确保分类器能够反映他们在现实中判断高风险消息的方式。


响应生成
如果输入被判定为安全,主LLM便会生成响应。
否则,可以忽略消息(针对越狱),或将其上报给人工处理(如果查询触发了安全问题标记)。
输出分类
在最终交付模型响应之前,我们会先在应用中对其进行分类。
鉴于部分响应可能使用基于互联网抓取数据的RAG技术,这一步可以保护我们免受数据投毒的影响。
如果响应包含不允许的内容,系统就会介入,并将其替换为通用消息。实践中这种情况极少发生,但这是一层审慎的额外保障,可确保智能体的行为始终适宜。
为了兼顾速度和经济性:
我们会存储常用提示、部分对话以及一组精选的少样本示例。
借助这种缓存机制,我们可以快速且低成本地应用LLM分类器,无需每次都重新构建上下文。


Anthropic最近的一项研究介绍了“宪法式分类器”:该系统依靠根据“宪法”规则训练的附加分类器,检测恶意或不安全的请求。研究报告称:
在数千小时的人工红队测试中表现出很强的稳健性。
误拒率极低,计算开销适中。
我们认为,未来这些宪法式方法可以补充甚至取代传统分类层,更全面地防御不断演变的越狱手段。
并行、轻量级过滤器
分类层可阻止恶意查询触及生成核心,并确保不会向用户交付不良输出。
用户体验至关重要
通过采用富有趣味、融入背景故事的警告和诙谐的拒绝方式,用户会更愿意接受系统限制。
测试和监控不可偷工减料
定期开展红队测试,并频繁监控玩家行为,有助于在漏洞被广大玩家知晓之前将其发现。随后可将这些漏洞反馈到少样本分类器的提示中,防止今后再次被利用(目前这仍是人工流程,但可以实现自动化)。
无论你是游戏公司、银行还是政府部门,只要计划大规模部署客服聊天机器人,就必须同时兼顾用户体验设计与可信度。
我们为具有以下需求的组织和品牌构建面向客户的解决方案:
安全至上——聊天机器人既要为用户创造价值,又要严格保护用户免受有害内容影响
保护声誉——我们设计多层防护,即使用户试图突破系统限制,也能维护品牌声誉
法规限制选择——我们及时掌握最新合规准则,让你能够放心扩展解决方案,无需担心应用遭到越狱