为高风险企业构建安全的对话智能体

打造代表品牌的聊天机器人时,仅仅确保安全还不够——它还需要原汁原味地传达你的品牌个性。

执行摘要

  • 面向公众的大语言模型(LLM)应用可能给品牌带来声誉和财务风险。

  • 我们采用分层分类过滤器,降低LLM越狱及其他非预期LLM行为造成的危害。

  • 我们已将这一方法用于一个大规模生产应用,该应用每天处理40,000条消息,而且数量仍在增长。

简介

过去一年里,我们与一家领先的游戏开发商合作,部署了一款生成式AI聊天机器人,每天为包括儿童在内的玩家群体处理约40,000条消息。兼顾速度、准确性、安全性和趣味性至关重要:

打造代表品牌的聊天机器人时,仅仅确保安全还不够——它还需要原汁原味地传达你的品牌个性。

对游戏公司而言,这意味着要兼顾安全性、趣味性和用户的兴奋感——尤其是在面对低龄用户时。

现代生成式AI应用所依赖的LLM非常灵活,因此能广泛适用于许多问题,但同时也缺乏足够约束。这意味着它们经常可能“偏离正轨”,生成各种各样的文本,其中有些内容可能并不适宜。

将LLM直接开放给公众必然会产生意外行为;如果没有适当的缓解措施,可能面临以下风险:

一窥现实世界中的风险……

LLM非预期使用引发的新闻头条:

这些事件凸显出,在生成式AI系统中构建并持续维护安全性绝非可有可无。涉及低龄儿童时尤其如此:不能只依赖免责声明,必须设置强有力的防护机制,确保内容适宜。

我们的方法:分层分类与提示缓存

与我们为客户构建的RAG(检索增强生成)系统类似,我们利用多个AI组件降低越狱风险,同时保持高性能。

展示我们所采用方法的示意图:分层分类与提示缓存。

系统的简化架构图

为确保系统安全,我们使用LLM分类器对输入和输出进行分类:

  1. 输入分类(并行运行)

  • 我们结合使用Pydantic架构和LLM结构化输出,为用户查询添加标签(例如SAFE、SUSPICIOUS、CHILD_HARM_RISK、VIOLENT等)。其中还包括用于识别越狱或违规行为的标记。

  • 与一个包罗万象的超大型分类器相比,针对各个主题使用多个分类器的效果明显更好。

  • 大量少样本示例至关重要,可以确保分类器区分“我一直被这个角色杀死”(指游戏情境)和“我的父母正在伤害我”(表明存在儿童受伤害风险)。

  • 通过与客户及其专业的信任与安全团队密切合作,我们确保分类器能够反映他们在现实中判断高风险消息的方式。

展示我们所采用方法的示意图:分层分类与提示缓存。

  1. 响应生成

  • 如果输入被判定为安全,主LLM便会生成响应。

  • 否则,可以忽略消息(针对越狱),或将其上报给人工处理(如果查询触发了安全问题标记)。

  1. 输出分类

  • 在最终交付模型响应之前,我们会先在应用中对其进行分类。

  • 鉴于部分响应可能使用基于互联网抓取数据的RAG技术,这一步可以保护我们免受数据投毒的影响。

  • 如果响应包含不允许的内容,系统就会介入,并将其替换为通用消息。实践中这种情况极少发生,但这是一层审慎的额外保障,可确保智能体的行为始终适宜。

为了兼顾速度和经济性:

  • 我们会存储常用提示、部分对话以及一组精选的少样本示例。

  • 借助这种缓存机制,我们可以快速且低成本地应用LLM分类器,无需每次都重新构建上下文。

展示我们所采用方法的示意图:分层分类与提示缓存。

展望未来:宪法式分类器

Anthropic最近的一项研究介绍了“宪法式分类器”:该系统依靠根据“宪法”规则训练的附加分类器,检测恶意或不安全的请求。研究报告称:

  • 在数千小时的人工红队测试中表现出很强的稳健性。

  • 误拒率极低,计算开销适中。

我们认为,未来这些宪法式方法可以补充甚至取代传统分类层,更全面地防御不断演变的越狱手段。

总结:我们的经验

  1. 并行、轻量级过滤器

分类层可阻止恶意查询触及生成核心,并确保不会向用户交付不良输出。

  1. 用户体验至关重要

通过采用富有趣味、融入背景故事的警告和诙谐的拒绝方式,用户会更愿意接受系统限制。

  1. 测试和监控不可偷工减料

定期开展红队测试,并频繁监控玩家行为,有助于在漏洞被广大玩家知晓之前将其发现。随后可将这些漏洞反馈到少样本分类器的提示中,防止今后再次被利用(目前这仍是人工流程,但可以实现自动化)。

构建面向未来、安全且引人入胜的生成式AI系统

无论你是游戏公司、银行还是政府部门,只要计划大规模部署客服聊天机器人,就必须同时兼顾用户体验设计与可信度。

我们为具有以下需求的组织和品牌构建面向客户的解决方案:

  1. 安全至上——聊天机器人既要为用户创造价值,又要严格保护用户免受有害内容影响

  2. 保护声誉——我们设计多层防护,即使用户试图突破系统限制,也能维护品牌声誉

  3. 法规限制选择——我们及时掌握最新合规准则,让你能够放心扩展解决方案,无需担心应用遭到越狱

作者

Andrew Liubinas