测试版 本网站处于测试版。信息仍在持续添加和审核中。
工作坊概览
1

AI 在日常工作中能做什么、不能做什么

为 AI 在机构日常工作中的作用设定切合实际的预期,并了解为什么聊天机器人听起来完全确定却仍然可能出错。

开场活动

梳理你们现在都用它做什么

  1. 每个人写下上周工作中请AI工具帮忙做的五件事,一行写一件。
  2. 在每件事旁边标一下:你有没有拿可靠来源核实过这个答案。
  3. 把纸条贴到墙上,把同一类任务归到一组,再把这面墙保留下来,作为机构第一次梳理AI真实用途的记录。

墙上这些任务里,哪些可能在没人核实的情况下直接送到服务对象手上?

一图看懂

AI 能帮上忙的事,以及必须严格核对的事

AI 确实能帮上忙的
  • 起草信件、邮件或通知的初稿
  • 把一份长文档压缩成要点
  • 翻译一段话的大致意思,先有个开头
  • 用通俗的话解释某项规定通常是怎么运作的
必须严格核对,因为 AI 经常在这些地方出错
  • 电话号码、地址、办公时间或截止日期
  • 金额或资格条件
  • 任何近期的、本地的、少见的,或涉及具体某个人的内容
  • 任何服务对象会据此采取行动的内容,都要与官方来源核对确认
规律很简单:AI 适合用来起草和解释,而每一个具体事实,在任何人据此行动之前,都要与真实来源核对。
  • 说出 AI 真正能帮上忙的日常任务:起草信件或邮件的初稿、把一份长文件浓缩成要点、翻译一段笔记的大意,以及获得对某项规则通常如何运作的简单说明。
  • 用简单的话解释聊天机器人为什么会编造内容,这种错误常被称为"幻觉",意思是听起来很有把握、但背后并没有真实依据的文字。它通过预测可能出现的词语来生成流畅的句子,因此可能编出根本不存在的诊所名称、电话号码、申请截止日期或资格规则。
  • 把编造的答案当作应该预料到的常见情况,而不是罕见的意外。在法律引用和参考文献等事实查询中,研究测得错误或编造的答案比例从四分之一到超过一半不等。
  • 认识到编造的答案读起来和正确答案一模一样,语气同样平静而自信,所以措辞流畅从来都不能说明某个细节是真实的。
  • 养成能保护服务对象的这一个习惯:在任何人据此行动之前,把会影响服务对象行为的信息——例如号码、日期、金额、地址或资格规则——对照官方来源核实清楚。
  • 留意自己和同事身上一种不易察觉的风险。人们往往会不加核实地接受流畅、自信的答案,研究者把这种现象称为"自动化偏见",也就是对机器的信任超出了证据所能支持的程度。
  • 看到服务对象,包括移民服务对象,已经在日常生活中使用这些工具,因此现实的目标是尽早引导安全使用,而不是试图阻止使用。
为什么这很重要(证据)

当聊天机器人被用来查询事实时,编造的答案很常见。在用法律问题测试主流模型时,Dahl 及同事,2024年发现大多数答案中都存在虚假或编造的信息,比例从 58% 到 82% 不等,具体取决于所用模型。被要求提供参考文献时,聊天机器人同样会编造。在一项比较中,Chelli 及同事,2024年发现有一个工具编造引用文献的比例超过 90%,另外两个工具的比例约在 29% 到 40% 之间。

更难解决的问题在于我们自己。使用计算机生成建议的人,即便建议是错误的、且眼前还有其他信息与之矛盾,也往往会接受它。一项系统综述把这种模式称为"自动化偏见",也就是对工具的信任超出了证据所能支持的程度(Goddard 及同事,2012年)。加入一点点"阻力"会有帮助。让人们在看到 AI 的建议之前先形成自己的答案,可以减少这种过度依赖(Buçinca 及同事,2021年)。

当任务是起草或浓缩内容而不是提供事实时,AI 的优势是真实存在的。在一项研究中,医生比较了机器撰写和专家撰写的临床摘要,结果显示,一个经过适配的模型生成的摘要在大多数情况下被评为与专家的摘要相当或更好(Van Veen 及同事,2024年)。即便如此,作者仍然发现偶尔出现的错误,所以在依赖摘要之前,仍需有人对照原文进行核对。

服务对象已经在使用这些工具。大约每 3 名美国成年人中就有 1 人表示会使用 AI 聊天机器人查询健康信息,而且许多人并不确信答案是否准确(KFF Health Information and Trust 民意调查,2024-25)。移民服务对象可能尤其愿意接受。在一项针对移民和普通人群成年人的研究中,移民表示更愿意使用 AI 心理健康聊天机器人(Yoo 和 Jang,2026年)。这种开放态度正是我们应尽早引导安全使用的理由。

再深一层

它的知识和盲区从哪里来

聊天机器人并不与真相直接相连,它是对训练所用文本的一种压缩画面。了解这幅画面里都有什么,能帮你判断在哪些地方可以信任它,在哪些地方需要核实。

模型的记忆有一个截止日期,需要提醒它去网上搜索最新信息

模型训练所得的记忆,是对截止到某个日期所收集文本的一张固定画面,因此它本身并不知道那之后发生了什么,也不会总是主动去查找信息。每当你需要与时间相关的信息,例如现行规定、截止日期、收入限额或今天的电话号码时,都要让工具去网上搜索,并展示它所使用的来源。实时搜索会有帮助,但也带来了自身的风险,因为答案的好坏取决于它找到的网页,而且它仍可能读错这些网页,所以无论如何都要对照官方来源核实任何近期或本地的信息。

常见的学得好,罕见的学不好

在训练文本中出现得多、反复出现的内容上,模型表现最强,例如用英语给出的通用健康说明。在文本稀少的地方,模型表现最弱,例如本地办事流程、规模较小的项目、服务对象所使用的语言,以及任何只与某个县或某家诊所有关的具体信息。这些空白并非随机出现,它们对应的正是网络上代表性不足的内容。

输入有偏见,输出也有偏见

训练文本带有人类的决策和不平等,因此模型也可能把它们再现出来。在一个有充分记录的案例中,一种被广泛使用的健康算法看起来公平,实际上却存在偏见,因为它用医疗支出作为衡量病情的替代指标,结果低估了黑人患者的实际需求(Obermeyer 等,2019)。AI 可能会以一种与服务对象身份相关的方式,自信地给出错误答案。

它只是反映,并不核实

无论内容是否正确,模型都会重复其数据中常见的说法,所以一个流行的误解也可能像事实一样被自信地说出来。因此,真正能判断某件事是否属实的,是你信任的来源,而不是模型的语气。

把这个工具当作大量过往人类文本的一面镜子。这正是它适合用于一般性说明和起草文字的原因,也是任何近期的、本地的、罕见的,或涉及具体某个人的信息都需要对照真实来源加以核实的原因。

关键之处

编造的答案看起来和正确答案一模一样

正确

Main Street 上的县诊所接受无预约就诊,直到 5 pm。按收入浮动的费用最低为 $15。请拨打 734-555-0143。

编造

Main Street 上的县诊所接受无预约就诊,直到 7 pm。按收入浮动的费用最低为 $10。请拨打 734-555-0198。

两个答案都以同样平静而自信的语气给出,措辞中没有任何地方能表明哪一个才是真的。营业时间、费用和电话号码都要先对照诊所自己的官网页面核实,任何人才能据此行动。
Case study

一个听起来很确定、号码却错了的答案

  1. 一位福利导航员向聊天机器人询问当地 Medicaid 办公室的电话号码,以及四口之家目前的收入限额,聊天机器人立刻给出了一个具体的号码和一个具体的美元数字。
  2. 这个答案表述流畅、听起来很确定,让人很想直接读给正在等待的服务对象听。
  3. 按照核实的习惯,这位导航员把这两项信息都当作尚未核实的内容,转而到州政府机构的官方网页上查证。
  4. 结果发现,那个电话号码已经过时,收入数字对应的是另一种家庭规模,这两项内容都是编造的,却看起来和正确答案一模一样。
  5. 这位导航员把核实过的号码和金额告诉了服务对象,并且只用聊天机器人起草了一份关于后续步骤的通俗语言摘要,在分享之前她自己先通读了一遍。
试一试

找出 AI 答案里编造的细节

朗读一段 AI 答案,其中提到一家诊所、给出一个电话号码,并说明一条资格规则,就像服务对象可能收到的那样。请大家说说他们在照做之前会核对什么。然后揭示:那个电话号码和年龄规则都是编造的,听起来和正确答案一模一样。每人说一句自己会用来与服务对象核对某个具体细节的话。

一起练习

把自己的任务按"AI 是否可信"分类

请每个人写下过去一周里三项可能会用到聊天机器人的任务。作为一个小组,把每项任务分成两堆。第一堆是 AI 帮忙措辞或压缩内容的任务,例如起草一封提醒邮件、把一项冗长的政策改写成通俗语言,或者为同事翻译一段笔记的大意。第二堆是 AI 会提供某个事实、而服务对象将据此行动的任务,例如办公室电话号码、申请截止日期、收入限额或资格规则。针对第二堆中的每项任务,说出你会用来核对它的官方来源。最后请大家留意:第一堆正是 AI 真正节省时间的地方,而第二堆恰恰是流畅、自信的答案最可能误导人的地方。