把这个决策变成一份采用清单
我正在核实我们机构是否应该采用我说明的这个 AI 工具。请建立一份简短的清单,逐项列出数据处理方式、是否用输入内容训练、是否有商业协议、机构批准情况、按我们的规模计算的真实成本、语言与无障碍覆盖情况,以及数据导出。对每一项,写出我应该向供应商提出的通俗问题,并留一个空白供他们的答复。 [说明工具名称,以及大致会有多少员工使用]
安全提醒。 这个工具无法替你核实供应商的答复是否属实,所以在服务对象数据进入之前,务必拿到每一项的书面答复。参见 模块 4。
This is a private beta prototype. Enter the password to continue. The content is unverified and must not be cited or relied upon.
Incorrect password. Please try again.
在你的团队采用某个 AI 工具之前,先用一份简短的清单来检验它,并在任何服务对象信息接触它之前拿到明确的答案。
工具通常按基准测试来排名,基准测试是一套固定的、已知答案的问题集。高分意味着这个工具在那套题目上表现不错。但有两件事会让一个分数无法真正告诉你想知道的东西。基准测试的题目有可能最终混进了这个工具的训练数据里,于是这个工具实际上已经提前见过答案,分数被灌了水。而基准测试的任务也可能和你的接案信件或资格问题完全不像,所以一个很高的分数,对你实际的工作说明不了多少。把一个分数当作一个提示来看,用你实际会做的任务来测试这个工具。
一个工具可以写出流畅、专业的文字,却仍然是错的,因为读起来顺畅和内容正确是两回事。一场演示是精心安排的,用的是供应商挑选好的材料,展示这个工具最好的一面。要判断一个工具是否合适,办法是把你自己真实的、低风险的任务拿去跑一遍,去除服务对象细节,然后对照原文核对结果。把关于数据和训练的问题放在同一轮一起问,因为一个不肯给出明确答复的工具,不管演示看起来多好,都不该接触服务对象信息。
表面的性能可能掩盖一个工具对谁服务得不好。一个被广泛使用的医疗算法被发现让黑人患者更少被转介去接受额外照护,原因是它用过去的医疗支出作为需求的替代指标,而且在整个使用期间,它看起来一直运作正常(Obermeyer 及同事,2019)。这给采购 AI 工具的启示是:一个看起来干净整洁的输出,并不能揭示这个工具是如何对待你所服务的人群的。询问数据处理和训练方式,把这些承诺写进一份商业协议里,并先在低风险工作上试用,这样一个错误的代价才低,容易被发现。
我正在核实我们机构是否应该采用我说明的这个 AI 工具。请建立一份简短的清单,逐项列出数据处理方式、是否用输入内容训练、是否有商业协议、机构批准情况、按我们的规模计算的真实成本、语言与无障碍覆盖情况,以及数据导出。对每一项,写出我应该向供应商提出的通俗问题,并留一个空白供他们的答复。 [说明工具名称,以及大致会有多少员工使用]
安全提醒。 这个工具无法替你核实供应商的答复是否属实,所以在服务对象数据进入之前,务必拿到每一项的书面答复。参见 模块 4。
这是一份供应商的数据或隐私政策页面。请用通俗的话说明:它说我粘贴的文字会发生什么,它是否会用我的输入来训练,我能否关闭这一点,以及它是否在一份商业协议里对此作出了承诺。列出这份页面表述含糊或没有回答的地方,方便我直接去问供应商。 [粘贴供应商的数据或隐私条款文字]
安全提醒。 通俗解读只是一个起点;在服务对象信息接触这个工具之前,要在一份签署的协议里确认这些承诺。参见 模块 4。
安全提醒。 如果一个工具无法清楚回答关于数据和训练的问题,就不要把服务对象信息放进去。参见 模块 4。