数百个提示词带给我们的对话式 AI 启示

数百个面向客户的提示词揭示了 AI 智能体如何保持一致表达、持续发挥作用,并体现统一的品牌声音。

执行摘要

  • 面向客户的 AI 代表着你的品牌,其所需的打磨方式与内部工具截然不同。

  • 实用的智能体与令人信服的智能体之间,差异更多在于理念而非技术,因为大多数提示词都被写成了指令集,而不是对话设计。

  • 语言学和认知心理学提供了更好的思路:对话具有结构,而提示词会营造一种注意力环境。最先放什么、重复什么以及如何收尾,都会切实影响智能体的行为。

  • 约束确实有用,但前提是足够精确。边缘情况过多会让互动变得生硬,也会使提示词臃肿难用;减少需要做出的决定,才能把注意力集中在更重要的决定上。

对企业而言,构建面向客户的对话式 AI 并非易事。

即便是技术的超级拥趸,已经让每位员工都采用 AI 协作,甚至开发了内部专用 AI 工具,要把 AI 推到企业与外界交互的前台,也完全是另一回事。

而且,这确实是一次晋升。当 AI 开始面向客户,它便从勤奋的实习生晋升为获得认可的正式员工,穿上工装,在客户眼中代表品牌。

这件事事关重大。如今,每一次失误都会暴露在公众面前,还可能被记录下来。

我们构建的产品往往是多智能体系统,其中包含业务层面的复杂交互。然而,这些逻辑反倒可能是比较容易的部分。更大的挑战是让用户相信,他们始终在与同一个智能体交谈,而且这个智能体说的内容值得听。

因此,我们一次又一次地撰写、改写提示词。

有些智能体要经过数百轮提示词迭代才能成形。它们的目标都一样:专注于任务,并以能引起人类用户共鸣的方式表达。

在不断改进提示词的过程中,我们开始以更具创意的方式寻找灵感。我们开始借鉴其他学科。当然,并非所有尝试都奏效;即便有效,也很少能一次成功。这些探索最终促使团队形成了一套不同以往的提示词设计范式。

来自语言学和认知心理学的提示词设计启示

一个只能按部就班完成任务的智能体,与一个深谙对话之道的智能体之间,并非只有技术差距,更有理念差距。这种差距存在于两个世界之间:一个是你通过提示词为智能体设定的世界,另一个是智能体实际身处的人类交流世界。

后者充满歧义,而人类对此早已习以为常;善意的交流者会遵循一套微妙且不言自明的话语规则,通过协作来应对这些歧义。准备不足的智能体很容易被识破。

为了维持“第四面墙”,也就是图灵测试营造的真实感,我们可以借鉴语言学和认知心理学,让智能体掌握对话的艺术。

语言学拥有一整套研究实际语言运用的工具,包括“会话分析”。它关注人们如何逐步组织和把控对话。将这一框架应用于提示词设计,可以让我们用一套新的概念来理解对话:对话不是言语的交换,而是行动的交换。

有些行动具有实用目的,例如获取或提供信息;另一些则具有社交目的,例如维持融洽关系或避免摩擦。这些互动发生在对话及其各个阶段构成的整体结构中,而每个阶段都有相应的预期行动。对话有开场和收尾,也有话题转换,甚至还有转换前奏——在这些有时略显尴尬的时刻,新方向被含蓄地提出、协商,并在言外之意中确定。

即使各方都抱有最大的善意,沟通不畅也时有发生。虽然人们掌握对话艺术的程度各不相同,但关键在于:智能体背后的 LLM 并不会天然具备哪怕普通人类交流者也拥有的直觉。

如何驾驭注意力,实现约束下的清晰表达

除了语言学分析,认知心理学还能提供互补的视角。它揭示了注意力、记忆和决策的实际运作方式:人们如何区别看待最先与最后出现的信息,特定触发因素如何稳定地引发某种行为,以及约束如何通过减轻认知负荷来释放能力。

提示词并不是承载指令的中性容器。它是一种注意力环境。因此,最前面放什么很重要。最后面放什么也很重要。重复什么同样重要。面对一份列表,人们通常更容易记住开头和结尾,而不是中间部分。心理学家称之为系列位置效应,包括首因效应和近因效应。

在实践中,我们发现 LLM 也有类似表现。最先出现的指引会确立整体框架:智能体是谁、扮演什么角色,以及预期会遇到怎样的世界。结尾的指引往往像是“它最后听到的内容”。如果把最重要的指令放在那里,这些指令更有可能得到落实。

我们不仅要仔细考虑各项指令在提示词中的位置,还应关注这些指令为智能体构成的整体边界。

指令通过约束智能体,减少它必须权衡的相互竞争的可能性,并缩小整体问题空间。提示词需要提供足够的约束,让智能体的任务保持在可控范围内。

在指导人类员工,尤其是经验较少的员工时,心理学告诉我们,明确定义当前任务、尽可能减少歧义,才能有效降低认知负荷。约束看似会限制自由,但减少需要做出的决定,可以让我们专注于余下的少数重要决策,并在限制范围内创造性地采取行动。

反过来,如果试图列举各种行为示例,覆盖所有想象得到的边缘情况,让智能体做出零决策,最终只会造出一个谈吐生硬的对话者。更不用说,这样的提示词会像用无数 if 和 else 拼成的“弗兰肯斯坦怪物”,臃肿不堪,维护起来简直是噩梦。

(说的就是少样本示例。)

边界合理的提示词能够明确方向,又不会让任务说明超载,导致智能体无所适从。这通常意味着给智能体设置更少的边缘情况或目标,无论是规定说什么、不说什么,还是如何说、不要如何说。

少样本提示与基于边界的提示

展示少样本提示与基于边界的提示之区别的示意图。

根据我们的经验,如果需要借助少样本示例来调整边界,就说明边界还不够精确。回到核心指令,继续打磨。

为更好的对话设计条件

从认知心理学角度出发,我们一直在思考各类指令应放在提示词的什么位置,并从数量和质量两方面判断需要哪些指令,才能恰当地限定智能体的问题空间。

结合之前从语言学角度对对话艺术的观察,我们可以把对话驱动型指令纳入智能体更广泛的任务边界,从而完善这套提示词设计范式。

对于面向客户的 AI,对话始终是一项元任务,无论我们是否意识到这一点。当我们选择在提示词中有意识地处理对话时,就意味着要让智能体投入部分处理能力或“认知负荷”,用于感知对话并做出响应,从而提升对话能力。

但代价是,我们很可能需要缩减主要任务的规模,才能让整体问题空间保持可控且边界清晰。

因此,对于面向客户的 AI,我们要从整体上设计有利于对话和决策的条件。我们的目标是打造规模更小、边界清晰的智能体,并把其主要任务置于对话这一元任务的情境中,或直接将对话纳入主要任务。我们不会堆砌大量指令,再通过示例逐步改进。我们只编写少量经过打磨的指令,并将其精确到无需示例。

这就是我们用来打造智能体的提示词设计范式:智能体不仅能专注于任务,还能优雅自然地进行对话。

梳理清楚理念框架后,下一篇博客将进一步探讨实践方法。我们将介绍一些关键模式,它们来自我们在现实环境中反复试验、将这些原则应用于提示词的过程。有趣的是,前沿模型提供商的提示词指南也开始呈现类似模式。下期详述。

作者

Douglas Smith、Sam Netherwood