测试版 本网站处于测试版。信息仍在持续添加和审核中。
AI 实际上能帮你做什么
9

负责任地选择工具

在你的团队采用某个 AI 工具之前,先用一份简短的清单来检验它,并在任何服务对象信息接触它之前拿到明确的答案。

如何挑选

先把任务匹配到工具,再匹配到数据规则

任务 合适的工具 一份快速的粗略草稿或摘要 一个免费、轻量的聊天机器人就够用 需要仔细推理的问题,或一份长文档 一个更强的付费模型物有所值 任何含有敏感服务对象数据的内容 任何消费级工具都不能用
合适的工具取决于任务和数据的敏感程度,而不是品牌名号;任何可能识别服务对象身份的内容,在任何档次的消费级工具里都不能出现。
  • 数据政策:询问这个工具收集什么、把数据存在哪里、又会和谁共享,并且要拿到书面答复。
  • 训练:询问它是否会用你的输入来训练,以及你能否关闭这一点,并寻找一份写明不会训练的商业协议。
  • 机构批准:在任何服务对象信息接触这个工具之前,先确认它符合你机构的政策。
  • 成本:按你们的实际规模算出真实价格,包括那些在演示里显得很小、但放到全团队使用就会增长的按用户或按次收费项目。
  • 语言与无障碍:确认它适用于你的服务对象和员工所需的语言与无障碍需求,因为一个在英语上很强的工具,在你所服务的语言上可能很弱。
  • 可迁移性:确保如果你不再使用这个工具,你能够导出并带走你的数据。
  • 一场华丽的演示或一个很高的基准测试分数,是一种销售信号,所以要先在低风险工作上试用这个工具,用你自己的任务来判断它,然后再信任它。

它是如何运作的,又会在哪里出错

基准测试分数衡量的是一次测试,而这次测试未必是你的工作

工具通常按基准测试来排名,基准测试是一套固定的、已知答案的问题集。高分意味着这个工具在那套题目上表现不错。但有两件事会让一个分数无法真正告诉你想知道的东西。基准测试的题目有可能最终混进了这个工具的训练数据里,于是这个工具实际上已经提前见过答案,分数被灌了水。而基准测试的任务也可能和你的接案信件或资格问题完全不像,所以一个很高的分数,对你实际的工作说明不了多少。把一个分数当作一个提示来看,用你实际会做的任务来测试这个工具。

流畅的输出也可能自信地出错,所以一场演示证明不了什么

一个工具可以写出流畅、专业的文字,却仍然是错的,因为读起来顺畅和内容正确是两回事。一场演示是精心安排的,用的是供应商挑选好的材料,展示这个工具最好的一面。要判断一个工具是否合适,办法是把你自己真实的、低风险的任务拿去跑一遍,去除服务对象细节,然后对照原文核对结果。把关于数据和训练的问题放在同一轮一起问,因为一个不肯给出明确答复的工具,不管演示看起来多好,都不该接触服务对象信息。

一个工具表面上看起来没问题,也可能在大规模使用中造成伤害

表面的性能可能掩盖一个工具对谁服务得不好。一个被广泛使用的医疗算法被发现让黑人患者更少被转介去接受额外照护,原因是它用过去的医疗支出作为需求的替代指标,而且在整个使用期间,它看起来一直运作正常(Obermeyer 及同事,2019)。这给采购 AI 工具的启示是:一个看起来干净整洁的输出,并不能揭示这个工具是如何对待你所服务的人群的。询问数据处理和训练方式,把这些承诺写进一份商业协议里,并先在低风险工作上试用,这样一个错误的代价才低,容易被发现。

你的团队正在权衡的一个工具 一份填好的采用决策清单
把这个决策变成一份采用清单

我正在核实我们机构是否应该采用我说明的这个 AI 工具。请建立一份简短的清单,逐项列出数据处理方式、是否用输入内容训练、是否有商业协议、机构批准情况、按我们的规模计算的真实成本、语言与无障碍覆盖情况,以及数据导出。对每一项,写出我应该向供应商提出的通俗问题,并留一个空白供他们的答复。 [说明工具名称,以及大致会有多少员工使用]

安全提醒。 这个工具无法替你核实供应商的答复是否属实,所以在服务对象数据进入之前,务必拿到每一项的书面答复。参见 模块 4

一份供应商的数据或隐私政策页面 一份关于它承诺了什么、没有承诺什么的通俗解读
获得一份供应商数据条款的通俗解读

这是一份供应商的数据或隐私政策页面。请用通俗的话说明:它说我粘贴的文字会发生什么,它是否会用我的输入来训练,我能否关闭这一点,以及它是否在一份商业协议里对此作出了承诺。列出这份页面表述含糊或没有回答的地方,方便我直接去问供应商。 [粘贴供应商的数据或隐私条款文字]

安全提醒。 通俗解读只是一个起点;在服务对象信息接触这个工具之前,要在一份签署的协议里确认这些承诺。参见 模块 4

实例分析

在真实任务面前露馅的那场演示

  1. 一位供应商向你的团队展示了一场精美的演示,工具把一份福利通知改写成整洁的通俗语言,看起来已经可以购买了。
  2. 在决定之前,你用自己的十份真实通知做了试用,去除了服务对象细节,并对照原文逐一核对每一份输出。
  3. 在你自己的材料上,这个工具读起来同样流畅,但在十份里有三份,它漏掉了一个截止日期,或改动了一条资格规则,而且语气完全自信笃定。
  4. 你还问了数据条款,发现你被展示的那个套餐会用你的输入来训练,而且没有商业协议来关闭这一点。你放弃了这个套餐,或者换成一个能就数据问题给出书面答复的档次。演示展示的是这个工具最好的一面,而你自己的低风险试用,才展示出它在你实际工作上的真实表现。

安全提醒。 如果一个工具无法清楚回答关于数据和训练的问题,就不要把服务对象信息放进去。参见 模块 4

来源
  1. Obermeyer, Z., Powers, B., Vogeli, C., & Mullainathan, S. (2019). Dissecting racial bias in an algorithm used to manage the health of populations. Science, 366(6464), 447-453. https://doi.org/10.1126/science.aax2342