简单说

所谓“幻觉”,就是AI编造出听起来真实但其实并不真实的信息。AI并不是故意撒谎,它是通过猜测下一个最可能出现的词语来生成答案的,所以它可能会用非常自信的语气说出一个根本不存在的诊所名称或电话号码。正因如此,在你根据重要答案采取行动之前,一定要先核实。

AI聊天机器人确实可以成为一个很有用的帮手。它可以帮你解释一封信的内容,帮你起草想问的问题,或者为你指出就医方向。但它也可能用平静、自信的语气给你一个错误的答案,而这一点正是需要了解清楚的地方。一旦你明白了原因,也知道该怎么核实,你就既能利用它有用的部分,又能避免它出错带来的风险。

要点速览
  • AI是通过预测最可能出现的词语来生成答案的,所以它可能听起来很有把握,实际却是错的。这种情况被称为“幻觉”(hallucination)。
  • AI最容易在具体事实、随时间变化的规则、你所在地区的信息,以及你使用的语言上出错。
  • 对于任何重要的事情,都要向AI询问信息来源,把它和LINC指南或官方网页对照,并向真人确认。

为什么AI会出错

AI聊天机器人并不像你查电话号码那样去查找事实。它是通过预测最可能出现的词语,一个接一个地生成每句回答,依据的是它在学习海量文本时发现的规律。大多数情况下这种方法效果不错,因为常见、广为人知的信息在那些文本中出现的频率很高。问题在于,无论它是否真的知道答案,都会用同一种方法。当它没有掌握正确的事实时,就会用“听起来对”的词语去填补空缺。结果可能是一个根本不存在的诊所、一个从未真实存在过的电话号码,或者一条已经过时的规则。

人们把这种情况称为幻觉(hallucination)。这并不是AI故意撒谎,而是它在做它一直在做的事,也就是猜测下一个最可能出现的词语,只不过在这种场合,光靠猜测是不够的。

这种情况并不罕见,也不只是理论上的可能。研究人员曾要求一个聊天机器人撰写带有参考文献的医学文本,结果它给出的大多数来源都是虚构或不准确的:这些来源要么指向根本不存在的研究,要么细节完全错误(Bhattacharyya et al., 2023)。AI并不是想欺骗谁,它只是在按照“来源通常长什么样子”来填空,就像它填一个电话号码或诊所名称时一样。

最容易出错的地方

AI的回答在几个可以预见的地方最不可靠。请留意以下几种情况:

  • 具体事实,比如电话号码、地址、诊所名称和网站链接。
  • 随时间变化的规则,比如谁符合Medicaid(医疗补助计划)的资格、某项目的费用是多少,或者截止日期是哪一天。
  • 你所在的地区。 一个全国性的答案,对你所在的城市或州来说可能是错的。
  • 你使用的语言。 AI用英语以外的语言回答时,准确性可能会下降。参见AI用你的语言回答时可能不够准确

语气自信并不能说明答案是否正确。无论AI的答案对还是错,它说话时的语气都一样笃定。

这不仅仅是电话号码和地址的问题。健康方面的建议如果自信地出错,也可能对你造成伤害。研究人员用模拟病人测试一个聊天机器人对常见疾病的判断,结果它常常能给出正确诊断(约四分之三的情况),也能选出合理的药物(约五分之四的情况)。然而在大多数这类情况中,它同时还建议了不必要甚至可能有害的药物,即使诊断本身是对的(Si et al., 2024)。像这样一个听起来流畅、合情合理的用药或症状回答,正是那种在你据此行动之前,需要向真人确认的类型。

还有一点值得了解:如果你告诉AI它错了,它往往会直接顺着你的说法改口,哪怕它最初的答案本来是对的。它被设计得容易顺从别人的意见。所以,它改变说法去迎合你,并不能证明什么,无论是证明它原来对还是错。判断一个问题的正确答案,应该去核对真实的信息来源,而不是和聊天机器人反复争论,直到它说出你想听的话。

需要留意

语气自信并不能说明一个答案是否正确,而且如果你提出质疑,AI往往会直接顺着你改口。无论是笃定的语气,还是改变后的答案,都不能证明什么。请对照真实的信息来源进行核实。

一个简短的例子

下面是一个虚构的答案,其中藏着一个很真实的错误。先读一读,看看你能不能发现问题所在。

你问:“我在我所在的州能申请Medicaid(医疗补助计划)吗?”

聊天机器人回答:“可以。Medicaid在每个州使用的收入上限都是一样的,所以只要你的年收入低于2万美元,在美国任何地方都符合资格。只需到任意一家医院的前台登记就可以了。”

这个回答听起来清楚又贴心,但其中有一个重要的错误。Medicaid在各个州使用的收入上限并不相同。 每个州都制定自己的规则,各州在覆盖哪些人这一点上差别很大。回答中那个全国统一的收入数字是编造出来的,目的是让答案听起来完整。关于”到任意一家医院前台登记”这句话,同样也是不严谨的说法。

问题的破绽在于:AI给出了一个简单、全国通用的规则,来回答一个实际上取决于你居住地的问题。每当一个答案把一条会因地区而异、会随时间变化的规则,压缩成一句斩钉截铁的话时,就该放慢脚步核实一下。你真正的资格取决于你所在的州、家庭人数以及其他细节,所以诚实的回答应该是引导你去联系你所在州的Medicaid办公室,或者找能够根据你的具体情况来判断的人。你可以在Medicaid.gov网站上查看各州规则的不同之处,并找到你所在州的项目信息。

一个可以长期坚持的核实习惯

你不需要逐字核实AI说的每一句话,但需要养成一个习惯,专门用来核实那些真正重要的答案。方法如下。

  1. 向AI询问信息来源。 输入”这个信息是从哪里来的?“或者”我应该查证什么来确认这一点?“一个有用的回答会指向你可以自己查看的具体内容。如果它说不出任何来源,那就是一个需要小心的信号。
  2. 把答案和LINC指南或官方网页对照。 看看本网站上的某篇指南,或者某个官方网页,是否说的是同一件事。如果是判断一般性的健康信息,美国国家医学图书馆的MedlinePlus网站有一份通俗易懂的指南,教你如何评估健康信息
  3. 对于任何重要的事情,都向真人确认。 诊所工作人员、社区健康工作者,或专业口译员,都可以在你采取行动之前帮你敲定细节。这一步在涉及金钱、文件、资格和医疗照护等决定时,是保护你自己的关键环节。
询问来源"这个信息是从哪里来的?"
对照核实参考LINC指南或官方网页
向真人确认用于任何重要的事情
核实重要答案的习惯:询问来源、对照核实、向真人确认。

想要及早发现误解,一个好办法是用自己的话把答案复述一遍。聊天机器人回答之后,把你理解的内容说给它听,然后问它:“我理解得对吗?“这样把内容复述一遍,往往能在小错误变成大问题之前就把它揪出来。

现在就试试。 打开Ask Chatbot(智能问答助手),提出一个你真正想问的问题。等它回答之后,回复它一句话:"这个信息是从哪里来的?我应该查证什么来确认?"看看它是否能给出一个具体的查证途径。这一个简单的追问,就是整个核实习惯的全部体现。

危险信号:什么时候该放慢脚步

有些答案比其他答案更值得多留个心眼。遇到以下情况,请把它们当作信号,在采取行动之前先停下来核实:

  • 你打算据此行动的具体号码、名称或链接。 你会拨打的电话号码、你会去找的诊所名称、具体金额、收入上限、日期,或者网址。这些正是AI最容易编造出来的细节。
  • 一条被简化成”放之四海而皆准”的规则,而实际情况因人而异。 如果一个答案把一条本会因地区而异、会随时间变化的规则说得斩钉截铁(比如”只要……人人都符合资格”),那它很可能掩盖了实际取决于你所在州、收入、家庭情况或身份状态的那些细节。
  • 任何涉及金钱、医疗覆盖、文件材料,或你的移民身份案件的信息。 在这些方面出错的代价很高,所以核实的门槛也应该更高。
  • 药物和症状。 剂量、药名、该吃什么药、什么时候吃,以及两种药物一起服用是否安全。这些都应该向药剂师、护士,或为你开处方的医生确认。
  • 说不出信息来源的答案。 当你问”这个信息是从哪里来的?“,如果它答不出任何具体的东西,就把这个答案当作一个猜测来看待。

如果以上情况都不涉及,比如你只是让AI解释一个词语,或者帮你起草一条消息,那你可以放心一些。核实的习惯是用在那些真正会带来实际后果的答案上的。

关于标注了来源的答案

一些较新的AI工具现在会在回答中附上链接或脚注,这确实是一项真正的进步。但这并不代表你可以省去核实的步骤。AI可能附上一个看起来很正式的链接,却对其中内容的描述是错的,或者指向的那个网页其实并不能支持它所说的内容。当一个工具给你提供了来源时,有用的做法是自己点开链接,读一读其中真正相关的部分。提供来源的意义在于让你能够核实它,而不是仅仅摆在那里充充样子。

核实不等于不信任

养成核实的习惯,并不意味着这个工具没用,也不意味着你应该对它说的一切都不理会。AI在帮你做准备工作时确实很有用:理解一个术语、起草想说的话、找到一个可以入手的方向。核实的意义在于,让你的信任程度和事情的重要性相匹配。在做准备工作时,可以放心大胆地使用AI;但在任何风险较高的事情上,最终的判断权应该交给真人或官方信息来源。

Sources


LINC是一个研究性原型项目,并非医疗或法律服务机构。翻译内容可能存在错误;你有权获得免费、专业的口译服务。对于任何风险较高的事情,请与社区健康工作者或你信任的人一起处理。如果遇到危机,请拨打或发短信至988;如遇生命危险,请拨打911