测试版 本网站处于测试版。信息仍在持续添加和审核中。
培训中心 模块 2

培养有分寸的信任

信任的程度要与工具本身相匹配。教练式培养具体的习惯,让来访者既不会全盘接受 AI 的回答,也不会因为害怕而拒绝真正有用的帮助。

学习目标

完成本模块后,社区健康工作者应能够:

  1. 用来访者能理解的一句话解释什么是有分寸的信任。
  2. 教练式培养以下习惯:先猜一遍、把答案当作草稿、期待工具说"我不确定"。
  3. 识别两种失衡方向:过度信任聊天机器人,以及拒绝准确的帮助。
  4. 引导那些不加核实就照搬 AI 答案的来访者。

培训流程

0:00–5:00
回顾与导入

回想模块 1:这个工具是在流畅地猜测。那么来访者应该在多大程度上信任某个具体答案?答案是"这要看情况,下面说明如何判断"。

5:00–17:00
这些习惯

先猜一遍(在读 AI 的答案之前先形成自己的想法)。把答案当作有待完善的草稿,而不是最终定论。期待并欢迎不确定性;一个说"我不确定,请与诊所核实"的答案,正是在尽它的本分。

17:00–25:00
失衡的两个方向

过度信任会导致按错误答案行事。全盘不信任会导致忽视有用的帮助、原地不动。目标是折中:把它用于草稿和后勤事务,核实任何重要的事情。

25:00–41:00
活动:教练式培养先猜一遍的习惯

进行下面的角色扮演。一位社区健康工作者扮演完全信任聊天机器人的来访者,另一位负责教练式引导这些习惯。

41:00–50:00
为什么解释还不够

一个自信的解释可能让错误的答案显得更有说服力,而不是更少。这就是为什么我们要培养的是行为习惯,而不只是"仔细阅读"。以一次复述确认收尾。

50 分钟
把角色扮演延长 5 分钟,让第二对搭档练习,即可达到 55 分钟。

教学要点

有分寸的信任,是指对这个工具的信任程度,大致与它在眼前这项任务上应得的信任相匹配:对电话话术多信一些,对资格规则少信一些,对危机情况完全不信。以下习惯让这一点变得可操作。第一,先猜一遍。在来访者读到 AI 的答案之前,先问问他们已经怎么想,这样答案就变成了可以拿来比较的东西,而不是必须服从的东西。第二,把答案当作草稿。草稿本来就是用来修改、核实、确认的,这正是我们想要的态度。第三,期待不确定性。当工具说它不确定时,这是有用的信息,不是缺陷;要肯定这一点,并通过找真人核实来采取行动。

同时也要留意相反的错误。有些来访者在被提醒 AI 可能出错之后,会决定对一切都不再信任,包括那些本可以帮他们更快获得照护的准确帮助。校准是双向的。传达的信息不是"永远别信它",而是"该信的事情就信它,其余的就核实"。

还有一点也值得点明:一个答案出错时,只会有两种出错方式。当 AI 的回答或任何筛查出错时,它只会朝两个方向之一出错。一种是误报(假阳性):本该回答"否"却回答了"是",比如告诉来访者符合某项福利资格,其实并不符合。另一种是漏报(假阴性):本该回答"是"却回答了"否",或者没能察觉真实存在的情况,比如告诉来访者不符合资格,其实符合,或者没有注意到有人正处于危机之中。哪一种错误更严重,取决于事情的利害轻重,而 AI 并不知道其中的利害,您才知道。在福利和资格方面,漏报可能让一个家庭失去他们本应得到的帮助。在安全和危机方面,漏报可能要付出生命的代价,所以要把任何真实的风险都当作真实来对待,并上报给真人处理。在法律或移民事务方面,误报可能导致一份对来访者有害的申报。在依据 AI 的回答采取行动之前,先想一想在此情况下哪一种错误会对来访者造成更大的伤害,然后重点核查那一种。

误报

本该是"否",却说了"是"。

说来访者符合某项福利资格,其实并不符合。

漏报

本该是"是",却说了"否"。

说来访者不符合资格,其实符合,或者没有察觉到危机。

在这里哪一种更糟
福利:漏报危害更大 危机:漏报危害更大 法律 / 移民:误报危害更大
AI 并不知道其中的利害,您才知道。请针对在此情况下会对来访者造成更大伤害的那种错误,最用力地去核实。
全都 不信 校准信任 全都 相信

校准是双向的。全盘不信任会让来访者原地不动、错过有用的帮助;盲目信任则会导致按错误答案行事。目标是折中:把工具用于草稿和后勤事务,核实任何重要的事情。

为什么这一点很重要(证据)

在关于人们使用 AI 做决策的研究中,一些小的"摩擦"步骤,比如在看到 AI 答案之前先自己拿定主意,降低了对错误建议的过度依赖,而仅仅展示一段解释并没有起到同样的效果(Bucinca 及其同事,2021)。在一项关于医疗提问的研究中,承认不确定性的措辞("我不确定,不过……")提高了普通人判断的准确性(Kim 及其同事,2024)。这些发现正是这些习惯的来源。

失衡是双向的:在两项预注册研究中,标注为"AI"的相同医疗建议被评为更不可靠,人们也更不愿意遵循(Reis 及其同事,2024,发表于 Nature Medicine)。这就是为什么我们既要教大家避免过度信任,也要教大家避免全盘不信任。

AI 还可能带有不易察觉的偏见:一种被广泛使用的健康风险算法对黑人患者的服务明显不足,因为它预测的是花费而不是病情(Obermeyer 及其同事,2019)。正因如此,我们才要把回答建立在经过核实的来源上,并核实重要的事项,好让隐藏的偏见不会悄然通过。

主要活动

角色扮演:完全信任聊天机器人的来访者

两人一组。一位社区健康工作者扮演已经认定聊天机器人永远正确的来访者,另一位负责教练式引导。来访者以这句话开场:

来访者"聊天机器人已经明确告诉我该去哪家诊所,还给了我电话号码,所以我已经知道该怎么做了。它甚至解释了原因。我不需要再打给别人了。"

教练的任务是引入这些习惯,而不是说教。好的做法包括:问来访者在看到答案之前自己是怎么想的;把 AI 的方案重新定位为需要一起确认的"初稿";提出一个具体的核实步骤(打电话给诊所,确认它接收新病人,并且接受来访者的保险)。复盘时讨论:教练是否把来访者的信任降到了一个有用的水平,同时又没有把他们推向彻底放弃这个工具?

LINC 聊天
我应该去哪家诊所做心理治疗?
在我给出建议之前,您已经了解到什么,或者有人告诉过您什么呢?您自己的想法是个不错的起点,我们可以一起核实。不管我给出什么建议,都只是需要和诊所一起确认的初稿,不是最终答案。
来自 LINC 的指南
同样的习惯也内置在产品本身里:它把问题抛回给来访者,让来访者先猜一遍,并把自己的回答定位为需要确认的草稿。钴蓝色徽章表明这条回答是基于 LINC 经过核实的指南。

材料

培训师自查
  1. 每位社区健康工作者能否凭记忆说出这些习惯?
  2. 角色扮演是否既处理了过度信任的问题,又没有把来访者推向全盘不信任?
  3. 我是否强调了一个自信的解释会让错误答案显得更有说服力这一点?