大多数提示工程侧重于准确性和指令覆盖度。生产环境中最大的提升,来自将对话本身视为核心设计问题。
明确“触发条件—行动”意图,是在指导模型如何决策,而不是给它一套无法摆脱的脚本。内容在提示中的位置本身就是一种指令。身份放在开头,行为细节放在中间,硬性约束放在结尾;真正关键的内容则首尾都要出现。
直接用目标语气撰写提示,而不是描述这种语气,是影响最大的改进之一。
最连贯的智能体会通过提示将不同的对话时刻视为不同的互动,让每种互动都有适当的形式,同时始终保持可辨识的一致语气。
在某些情况下,将负责思考的智能体与负责表达的智能体分开,可以生成更连贯、更有依据的回复,并防止内部推理泄露到回复中。
此前,我们基于语言学和认知心理学领域的洞见,提出了一种新的提示设计范式。我们探讨了为何要构建一个边界清晰、界定明确的问题空间供智能体运作,以及这个问题空间为何需要涵盖面向客户的 AI 所固有的对话元任务。
现在,我们来看看在尝试将这些原则投入生产的过程中,提示在实践中发生了哪些变化。
在面向真实客户的系统中,经过数百轮提示迭代,最大的提升并非来自增加指令、堆砌示例或遵循常规提示工程规范。相反,它来自真正将对话视为问题的核心。
经过持续探索和测试,我们总结出了一些行之有效的技巧。我们修改提示,观察对话在哪里成功或失败,再追溯失败与指导效果、提示结构和语言运用之间的关系。由此形成了几种可复用的模式,它们能改变智能体理解自身对话职责的方式、决定下一步行动的方式,以及在情境变化时保持语气一致的程度。
以下内容并非通用框架,也不是宣称提示设计已经“彻底解决”。它只是将生产环境中经受住考验的做法提炼成五种模式。在这里,目标不只是功能准确,还包括更好的对话:回复要连贯、自然,并保持足够一致的品牌语气。
智能体系统有多种构建方式,而多智能体编排工作流依然广受欢迎。尤其在这类系统中,我们最稳定有效的改进是将负责思考的智能体与负责交流的智能体分开。
意图编排、分类、知识提取和工具使用都属于后台操作。面向客户的回复则属于前台。如果同一个智能体在同一轮对话中兼顾两者,内部推理和逻辑就可能泄露到回复中。回复会变得含糊保守、充斥限定条件,或围绕处理流程的逻辑组织,而不是以用户需求为中心。


仅这一条约束,就发挥了出人意料的巨大作用。它让回复立足于当前对话,避免上下文被重置,并使智能体更接近我们所说的“只传达增量”:最终只补充真正能推动用户前进的最少新信息。
决定给出哪种类型的回复也同样重要。我们发现,要求负责交流的智能体在动笔前先选择行动类型——回答、澄清、引导或等待——能可靠地减少最常见的对话失误:问题并非文字写得差,而是整个回应方向都错了。
值得注意的是,在适当条件下,最新的前沿模型正开始挑战这一模式的前提。尽管如此,许多开发者出于各种原因仍在使用较小或较旧的模型。在这些情况下,我们仍然强烈建议将后台事务与前台事务分开。
对于非推理模型,少样本示例很有效,因为它们具体、快捷,而且模型响应良好。问题在于过拟合。给模型一个示例,它就会紧盯其中的措辞、节奏和结构;即使情境已经改变,仍不断生成与原回复高度相似的变体。
你无意间写出了一套模型无法摆脱的脚本。
执行意图或启发式规则是更持久的替代方案。我们不会向模型展示在特定情境中该说什么*,*而是提供适用范围更广的触发条件与行动组合:如果发生 X,就执行 Y。
关键区别在于,我们不会通过逐个添加示例来不断缩小 X 和 Y 的范围、使其日益僵化,而是用足够精确的指令为两者划定明确边界,让示例变得多余。这样,智能体就能响应真实对话中的变化,而不是套用模板进行模式匹配。
在实践中,它们不像示例,更像可以直接执行的经验法则:
如果缺少关键信息,就提出一个澄清问题。
如果没有依据支持答案,就直接说明,并提供当前最佳的下一步建议。
如果请求触发护栏,就简短拒绝并直接引导到其他方向。
这种方法并不花哨,却远比一套回复范例更稳健,因为它教模型如何作出决定,而不是该重复什么。
内容在提示中的位置会影响它所占的权重。我们在不同模型和部署环境中都持续观察到这一规律。提示开头和结尾的显著性远高于其他位置。中间适合放置细节和微妙之处,而它们本就该放在那里。
我们据此安排提示的结构。将智能体的职责和自我认知放在开头,先于其他内容确立身份。中间承载行为细节:对话可能如何展开、指导回复的启发式规则,以及智能体需要处理的各种情境。硬性约束和不可妥协的要求放在结尾,让模型对其“念念不忘”。
凡是真正关键的内容,我们会在开头和结尾各放一次。具体的输出规则——例如关于标点或格式的硬性指令——如果只在内容密集的提示中间出现一次,往往会被忽略。在结尾重复一次,它就更容易生效。
谈到近因效应,值得注意的是:使用结构化输出时,它实际上就是提示中的最后一条指令。结构化输出中的描述字段会在内容层面影响回复,形成比提示其余部分更有约束力的输出契约。


我们也已认识到,不应使用少样本示例来规定语气。这是我们对面向客户的智能体所做的影响最大的改进之一。
我们转而直接用目标语气撰写整份提示。不是描述这种语气,也不是罗列一组大致贴近它的形容词,而是从第一行到最后一行都用完整自然的文字呈现这种语气。提示本身就是示范。我们称之为“反脚本化”:引导模型模仿输入,同时允许它使用更多样的语言和表达,只要与提示本身保持在同一风格范围内。
我们以此在统一的语气中实现表达的多样性。这是我们将对话置于任何智能体任务核心的策略之一,而且无需耗费篇幅编写显式指令;这类指令正是我们力求精简的内容。
如果确实要为语气提供明确示例,我们会示范“不要怎么做”。例如:“绝不使用破折号。不要用陈词滥调。不要一股脑罗列政策。一句话能说清,就不要过度解释。”与正向愿景相比,负面约束既更精确、限制也更少,因为它们直接指出模型最容易偏向的失败模式。
格式同样重要,它也会为回复定下基调。充斥项目符号、标题和括号指令的提示,会引导模型生成更有条理、更冷静客观的输出。如果输出要给人对话般的感觉,输入就不该像一份简写的规范文档。
大多数语气提示最终都会归结为个性描述。也就是给出一组形容词,描述智能体说话应是什么感觉。温暖。专业。友好但简洁。这些说法并没有错,但真正决定一种语气在对话中给人何种感受的是语域:同一种基本个性在不同社交情境下如何表现。
处理查询时显示的等待消息,不应听起来像最终答案。触发护栏时的回复,不应和闲聊一样热络。面对沮丧的客户,不应像对待随意浏览的客户那样风趣幽默。


这正是品牌语气与对话设计的区别。品牌语气通常描述个性,而对话设计则决定这种个性在情境变化时如何表现。做好这一点,意味着我们不只是为 AI 输出润色文案。我们设计的是一种语气如何贯穿整场对话。
你会发现,这些模式在技术上都不复杂。这恰恰是重点之一。智能体系统的架构固然重要,但要提升对话质量,还需要投入大量时间设计和完善提示。
要跨越纯功能型 AI 与真正对话式 AI 之间的鸿沟,靠的不是技术设计,而是更清楚地理解人类对话中语言与注意力的运作方式,并将对话置于智能体问题空间的核心。
对于 AI 产品团队、工程师和体验设计师而言,在面向客户的 AI 中,对话设计理应像卓越技术一样受到严谨对待。对话另一端的人看不到模型、多智能体协作或工具调用——他们只会感受到一次自然或别扭的互动。这次互动要么建立信任,要么消磨信任。
归根结底,没有人会直接体验架构。他们体验的是对话。
对话就是产品。