测试版 本网站处于测试版。信息仍在持续添加和审核中。
AI 实际上能帮你做什么
5

建立可重复使用的提示词库

有效的提示词值得保存下来。共享的提示词库意味着没有人需要从一个空白框开始,一条写得好的提示词只需写一次就能在全团队传播使用。

这个结构

一条可靠的提示词会写清楚的内容

角色 扮演一位个案工作者,以 6 年级的阅读水平给服务对象写信。
任务 说明预约时需要携带哪些文件。
格式 一份简短的编号列表,120 词以内,语言通俗。
安全提醒 如果不确定某个细节,就明确说明;不要凭空编造办公时间或规定。
一条保存下来的提示词,只要写清楚角色、任务、格式和安全提醒,结果就能可重复,而不是碰运气。
  • 把有效的提示词保存在共享文档里,这样就没有人需要凭记忆重新拼凑一条好用的提示词,一个人调好的提示词也就能变成全团队都可以直接使用的东西。
  • 给每一条提示词起一个说明用途的通俗名字,并做一个填空版本,用标注清楚的占位符,比如 [粘贴文字,不含服务对象身份信息],来代替真实细节。
  • 在每条提示词上加一行说明,注明使用结果前需要检查什么,因为这条保存下来的提示词日后会被没有写过它的人运行。
  • 把实际有效的措辞原样写下来,包括你要求的格式和你给出的任何范例,因为措辞或范例上的微小改动都可能改变结果。
  • 让每一条保存下来的提示词都不含服务对象姓名、A 号码和案件细节,这样共享库就不会悄悄变成服务对象数据的积存地。
  • 让员工也能添加提示词,并标出经得起检验的那些,这样这个库反映的就是你们项目里实际有效的东西,而不只是一次看起来不错的结果。
  • 给每条提示词标注日期,并在你的工具发生变化时重新检查这个库,因为一条在某个版本工具上有效的措辞,可能会悄悄开始返回不一样的结果。

它是如何运作的,又会在哪里出错

模型是从提示词本身学会这项任务的

当你给这类工具一条提示词时,它并不会重新训练。它读取你的措辞和你给出的任何范例,并针对这一次对话给出答案,也就是依据眼前这段确切文字来作答。这种从提示词里给出的指令和少量范例中学会一项任务的行为,被称为情境学习(in-context learning),并已被证明能在大规模模型上有效运作(Brown 及同事,2020)。这正是为什么一条清楚的指令加上一个已经完成的范例,往往比一个空泛的请求更能带来好结果,也是为什么把一条有效的提示词逐字保存下来是值得的。

措辞上的微小改动就可能改变答案

因为模型是依据你的确切文字来作答的,当你改写措辞、调换范例顺序,或改动格式时,同样的请求可能会得到不一样的结果。一项对照研究发现,仅仅改变提示词的格式、意思保持不变,就能让模型在同一项任务上的准确率大幅波动(Sclar 及同事,2024)。对机构工作而言,这意味着有人调好的提示词是一项具体的资产,而凭记忆重新打出来,可能会悄悄改变服务对象最终看到的结果。

一条保存下来、经过检验的提示词,是一小块质量把关

一旦一条提示词能可靠地给出你需要的结果,把这份确切的措辞保存下来,就能把一次偶然的好结果变成可以重复的结果。每个人运行这份保存下来的版本,起点都是经过检验的措辞,所以输出在不同人之间的差异更小,你的注意力也能放在核实结果上,而不是重新拼凑请求。把需要检查的那一行说明和提示词一起保存下来,意味着这道核实步骤会一直跟着它,传给下一个使用它的人。

让提示词可以重复使用
如何把一条提示词变成团队可以重复使用的模板
  1. 给它起一个说明用途的通俗名字,比如「根据政策制作的通俗语言资料单」。
  2. 把具体细节替换成标注清楚的占位符,比如 [粘贴文字,不含服务对象身份信息]。
  3. 加一行说明,注明结果发出前需要检查什么。
  4. 把它保存在整个团队都能打开和编辑的共享文档里。
  5. 记下日期,并在工具发生变化时重新检查它。
一条曾经有效的提示词 团队可重复使用的模板
把一条曾经有效的提示词变成团队可以重复使用的模板

把这条提示词改写成一个干净、可重复使用的模板。把任何具体细节替换成标注清楚的占位符,不含姓名和身份信息,并加一行提醒使用者在使用结果前需要检查什么。 [粘贴你想保存的提示词]

安全提醒。 把模板存放在团队能找到的地方,并确保其中不含服务对象身份信息。

一条你觉得有效的提示词 一条经过压力测试的提示词
在提示词入库前先给它做压力测试

这是一条我想为我的团队保存的提示词。请按原样运行它,然后告诉我它的措辞在哪里含糊不清、使用者可能粘贴什么内容让它失灵,以及输出可能在使用者没有察觉的情况下出错的地方。给出一个更严谨的版本,并列出使用者在信任结果之前应该检查什么。 [粘贴你想保存的提示词]

安全提醒。 把改好的提示词存放在团队能找到的地方,并确保其中不含服务对象身份信息。参见 模块 6

一堆保存下来的提示词 一份整理有序、方便查找的索引
整理一份简短的索引,让提示词库保持可用

这是我团队保存的一份提示词标题清单。请把它们分成几个通俗的类别,为每一类建议一句话说明,方便新员工知道何时使用它,并标出任何看起来重复的两条,方便我们合并。 [粘贴你的提示词标题清单,不含服务对象身份信息]

安全提醒。 这个工具能整理标题,但无法判断哪条提示词安全或是最新的,所以每一条留在库里之前都要由人来审核。参见 模块 6

实例分析

同一条提示词,凭记忆重新打出来

  1. 一位个案工作者有一条能可靠地把福利通知变成通俗语言资料单的提示词,它会在结尾列出每一个日期和金额,方便核对。
  2. 一位同事很喜欢这个结果,于是凭记忆重新打了这条提示词,却漏掉了要求列出日期和金额的结尾那一句。
  3. 这位同事的版本读起来同样流畅,但资料单不再把截止日期整理成可核对的清单,一个申报日期就这样被埋进了一段容易被忽略的文字里。
  4. 他们逐字复制了保存下来的提示词,可核对的清单又回来了,随后把这份确切的措辞加进了共享库,让下一个人从这条经过检验的提示词开始。

安全提醒。 一条共享的提示词只有在不含服务对象数据时才是安全的。保持提示词库的整洁,并把定期检查它变成团队的习惯。参见 模块 4模块 6

来源
  1. Brown, T. B., Mann, B., Ryder, N., Subbiah, M., Kaplan, J., Dhariwal, P., Neelakantan, A., Shyam, P., Sastry, G., Askell, A., Agarwal, S., Herbert-Voss, A., Krueger, G., Henighan, T., Child, R., Ramesh, A., Ziegler, D. M., Wu, J., Winter, C., ... Amodei, D. (2020). Language models are few-shot learners. In Advances in Neural Information Processing Systems 33 (pp. 1877-1901). https://arxiv.org/abs/2005.14165
  2. Sclar, M., Choi, Y., Tsvetkov, Y., & Suhr, A. (2024). Quantifying language models' sensitivity to spurious features in prompt design or: How I learned to start worrying about prompt formatting. In The Twelfth International Conference on Learning Representations (ICLR). https://arxiv.org/abs/2310.11324