服务对象数据与 AI:隐私速览指南
消费级 AI 工具的设计初衷并非用来保存敏感的服务对象信息。把服务对象的详细信息输入其中,或者让 AI 助手打开并读取服务对象的档案,都和做一份私人笔记不一样。这是一种数据共享行为,对移民或难民服务对象而言,后果可能很严重,有时甚至无法挽回。本指南在工作坊模块"绝不能输入 AI 工具的内容"的基础上作了更深入的探讨。请打印出来,放在办公桌附近,并在打开聊天机器人之前先看一遍核对清单。
移民和难民服务对象早已在权衡联系是否安全
这种谨慎不是多疑,而是有据可查的。Friedman 和 Venkataramani(2021)将全国调查数据与移民及海关执法局(ICE)的执法活动进行匹配,发现在本州 ICE 执法活动增加后,西语裔成年人报告有固定医疗服务提供者或年度体检的可能性下降,而非西语裔成年人没有出现这种变化。Young 及同事(2023)发现,在加利福尼亚州的拉丁裔和亚裔移民中,每增加一次与执法系统的直接接触,就医推迟的几率就会上升(比值比 1.30,95% 置信区间 1.10 至 1.50)。Herring 和 Barnow(2025)估计,"安全社区"(Secure Communities)项目实施后,合法居留的年长西语裔移民——这一群体本身并没有被驱逐出境的风险——就诊次数下降了 16.9%;这一模式表明,恐惧和连带影响才是驱动因素,而非直接被驱逐本身。
这对 AI 使用的启示很直接。服务对象的移民身份、A 号码或案件细节,都不是普通的联系信息。一旦泄露、被传票调取,或在数据泄露事件中曝光,都可能使服务对象或其家庭面临被执法、被拒绝救济,或在原籍国受到伤害的风险,而这些后果并非总能挽回。要把每一次把服务对象信息输入外部工具的行为,都当作承载着这样的分量。
输入即是发送
当你在聊天机器人中输入文字、粘贴文档,或让 AI 助手打开并读取服务对象的档案时,这些内容就会离开你的电脑,传到供应商的数据中心,并在其服务器上被处理。无论是你自己输入的,还是助手替你读取文件的,情况都是一样的:让工具读取一份文件,本身就是把该文件的内容传输给了这家公司。这不是一份私人笔记,而是与一家你无法掌控的公司之间的数据共享行为。
接下来可能发生两件不同的事,值得区分开来。"被存储"是指供应商在一段保留期内保存你输入内容的副本,在此期间,该公司的系统可以读取它,员工或承包商可能在某些条款下查阅它,它可能在数据泄露事件中被曝光,也可能因传票而被提交。"被用于训练"是指你输入的内容被用来改进模型本身,从而成为模型学习内容的一部分。一个工具可以承诺不用你的数据来训练,却仍然存储它,所以你需要同时了解这两个答案,而不只是其中一个。
模型可能记住并复述其训练数据
这并非假设。Carlini 及同事(2021)证明,可以诱使语言模型逐字吐出其训练数据中的片段,他们从 GPT-2 中提取出的内容里就包括真实的可识别个人信息,包括姓名、电话号码和电子邮箱地址。Carlini 及同事(2023)随后证明,这种记忆化程度会随着模型规模的增大、某段文本在训练中被重复的次数增多,以及攻击者提供的周边上下文增多而上升。
对从业者而言,这意味着输入到一个会用输入内容进行训练的工具中的信息,不仅现在会被供应商看到,日后还可能被呈现给别人看到。这就是提取风险,也是为什么在把任何敏感内容交给某个工具之前,值得坚持要求一份书面的"不用于训练"条款的原因之一。
加密能保护你不受外部人员侵扰,却保护不了你不受供应商侵扰
正规工具会对传输中的数据进行加密,使其在跨越网络时无法被读取,也会对静态存储的数据进行加密,使存储的文件在磁盘被盗时也无法被读取。加密(encryption)能防范外部人员。它无法保护你不受供应商侵扰,因为供应商为了处理内容,必须先对其进行解密。加密并不等同于对持有数据的公司保密。
大多数你通过浏览器或应用程序使用的 AI 工具都是云端工具:数据离开你的掌控,交给第三方。本地或设备端(on-device)模型运行在你自己的设备上,不会把内容发送出去,这是一种从根本上不同、总体上也更安全的风险状况。默认设置也取决于产品的套餐级别。免费的消费级工具默认风险最高;OpenAI 声明,除非用户关闭训练选项,否则消费级 ChatGPT 的对话内容默认会被用于训练其模型,而其 Business、Enterprise、Team、Edu 及 API 产品默认不会被用于训练模型(OpenAI,2026 年访问)。各家条款各不相同且会变化,所以永远不要想当然,并且要记住,默认能接触到的免费版本,通常正是保护最弱的那个版本。
你的数据流向何处
无论是你自己输入的信息,还是你让某个助手读取的文件,路径都是一样的。
- 你输入或上传你输入一条信息、粘贴一份文档,或让 AI 助手查看服务对象的档案以进行总结或阅读。
- 它离开你的设备无论是你自己输入的,还是助手替你读取的文件,内容都会通过互联网传送到供应商那里。
- 它抵达供应商的数据中心供应商的服务器对其进行处理。员工或承包商在某些条款下可能可以访问它。
- 它被存储,也可能被用于训练供应商可能会在一段保留期内保存一份副本,除非训练功能被关闭,否则也可能另外用它来改进未来的模型。
加密(encryption)保护的是这段传输过程不被外部人员窃取,但无法阻止另一端的供应商读取你发送的内容。
"绝不能输入"清单
不要把以下任何一项输入消费级或未经批准的 AI 工具,无论是直接输入,还是让工具读取包含这些信息的文件。
其中任何一项都可能指向某一个具体的人,如果再与消息中的其他内容组合,识别范围会进一步缩小。
仅仅泄露一个社会安全号码,就足以引发身份盗用和欺诈,并可能困扰服务对象多年。
这些信息会把一条消息直接与某个移民案件或法律案件档案,以及执法系统关联起来。
身份及其历史正是执法行动所依据的关键细节;它们绝不应留存在供应商的服务器上。
这是受保护的临床信息,一旦数据泄露或被传票调取,就可能暴露服务对象最私密的经历。
案件细节可能在诉讼中被曝光,或以服务对象从未同意的方式被用来对付他们。
去掉姓名并不能让一份记录变得匿名
去标识化是指把信息剥离到无法再追溯到某个人的程度:不仅要去除姓名、号码、住址等直接标识符,还要去除那些组合起来能够指向某人的准标识符。把"María,出生日期 1990 年 3 月 12 日,A 号码 087..."替换成"一名服务对象",只是个开始,并不是终点。
真正重要的是这种做法的局限性。Rocher、Hendrickx 和 de Montjoye(2019)使用一种即使在数据集不完整时也依然成立的方法估计,仅凭 15 项人口统计学属性,就能从任意数据集中正确地重新识别出 99.98% 的美国人。少量普通属性的组合就足以把某个人单独锁定,所以去标识化从来都不是万无一失的,而且它失效得最快的地方,恰恰正是你服务对象所在之处:少数语言、特定的原籍国、小城镇,以及不常见的案件情形。
自由文本叙述尤其容易泄露信息,因为它们携带着大量清单永远不会想到要删除的偶然细节。安全的做法不是把一份真实记录去标识化后再粘贴进去。而是像在培训中提问那样,使用通用、假设性或汇总的说法,不要把它和某个真实的人挂钩。如果你不愿意在服务对象在场的拥挤公共场所大声读出这句话,就不要输入它。
这些内容能输入这个工具吗?
按顺序逐一通过这些关卡。在任何一道关卡停下,就意味着必须停止。
- 这个工具是否在你机构批准的名单上,并签有数据协议?如果不是,就停止。请使用经批准的工具,或者不使用任何工具。
- 内容中是否包含"绝不能输入"清单里的任何一项,包括在附件文件内部?如果是,就停止,或者先删除并做概括处理后再继续。
- 剩下的细节组合在一起,是否可能识别出某一个具体的服务对象、家庭或小型社区?如果是,或者你不确定,就停止。应假设小群体的细节具有可识别性。
- 你是否知道这个工具不会用你输入的内容进行训练,并且有明确规定的保留期限?如果不知道,就停止,直到你能确认为止。
- 如果这段确切的文字明天就公开,是否可能伤害到该服务对象或其家庭?如果是,或者你不确定,就停止。
只有在你通过了每一道关卡之后才能继续,即便如此,也只输入最少必要的信息。
在机构采用某个工具之前应当要求什么
在涉及服务对象信息的工作中采用一个 AI 工具,是一项机构层面的决定,而不是个人决定。
美国卫生与公众服务部(HHS)要求,任何代表你方创建、接收、维护或传输受保护健康信息的供应商都必须签署《商业伙伴协议》(Business Associate Agreement,BAA);一项存储或处理该信息的云服务也算在内。对于其他敏感数据,应要求签署对等的数据处理协议(data processing agreement)。
供应商的条款应以书面形式说明,你输入的内容不会被用于训练其模型,并且应有人确认该设置确实按此配置,而不仅仅是"可供选择"。
了解输入内容会被保留多久,你是否可以要求删除,以及是否存在零保留或不留日志(no-log)的选项。优先选择你能争取到的最短保留期。
不应由个别员工逐一决定使用哪个工具。机构应维护一份清单,说明哪种内容允许使用哪些工具,并指定一位可以咨询的负责人。
传输中加密和静态加密、访问控制,以及数据泄露通知承诺都是必要的,但它们防范的是外部人员,无法替代上述关于训练和保留的条款。
快速核对清单
- 这个工具在我们机构针对此类内容的已批准清单上。
- 有一份涵盖该内容的已签署数据协议(BAA 或同等文件)。
- 供应商的条款说明输入内容不会用于训练,并且该设置已获确认。
- 保留期限是明确的,并且尽可能短。
- "绝不能输入"清单中的任何一项,都没有出现在我的文本中,或出现在我要求工具读取的任何文件里。
- 各项细小信息的任何组合都不可能识别出某一位服务对象或某个家庭。
- 我使用的是通用或假设性的表述,而不是真实的服务对象记录。
- 如果这段文字明天就公开,不会有任何服务对象因此受到伤害。
- 当我不确定时,我会停下来,去询问负责管理我们工具的人。
资料来源
- Friedman, A. S., & Venkataramani, A. S. (2021). Chilling Effects: US Immigration Enforcement and Health Care Seeking Among Hispanic Adults. Health Affairs, 40(7), 1056–1065. doi:10.1377/hlthaff.2020.02356
- Young, M.-E. D. T., Tafolla, S., Saadi, A., Sudhinaraset, M., Chen, L., & Pourat, N. (2023). Beyond “Chilling Effects”: Latinx and Asian Immigrants’ Experiences With Enforcement and Barriers to Health Care. Medical Care, 61(5), 306–313. doi:10.1097/MLR.0000000000001839
- Herring, J., & Barnow, B. (2025). Indirect effects of immigration enforcement on health care utilization among lawfully present older Hispanics. Social Science & Medicine, 384, 118540. doi:10.1016/j.socscimed.2025.118540
- Carlini, N., Tramèr, F., Wallace, E., Jagielski, M., Herbert-Voss, A., Lee, K., Roberts, A., Brown, T., Song, D., Erlingsson, Ú., Oprea, A., & Raffel, C. (2021). Extracting Training Data from Large Language Models. 30th USENIX Security Symposium (USENIX Security 21). link
- Carlini, N., Ippolito, D., Jagielski, M., Lee, K., Tramèr, F., & Zhang, C. (2023). Quantifying Memorization Across Neural Language Models. The Eleventh International Conference on Learning Representations (ICLR 2023). link
- Rocher, L., Hendrickx, J. M., & de Montjoye, Y.-A. (2019). Estimating the success of re-identifications in incomplete datasets using generative models. Nature Communications, 10, 3069. doi:10.1038/s41467-019-10933-3
- OpenAI (2026). How your data is used to improve model performance; Enterprise privacy. OpenAI help center and enterprise privacy page (accessed 2026). link
- U.S. Department of Health and Human Services (2026). Business Associate Contracts; Guidance on HIPAA & Cloud Computing. HHS.gov (accessed 2026). link
本指南所述做法基于上文列出的研究。请根据贵机构的政策,以及你所服务的语言和社区,对其加以调整。