测试版 本网站处于测试版。信息仍在持续添加和审核中。
AI 实际上能帮你做什么
7

用大白话说代理式 AI

较新的工具不只是回答问题,它们会代表你执行多步骤的操作。这种能力很有用,同时也提高了风险。

实际发生的事

一个代理读取你的文件,等于把它们发送了出去

你把它指向一个文件夹并给它一项任务
它读取这些文件也就是把文件上传到一个数据中心
它替你行动编辑、发送、执行各个步骤
第一步:确认数据处理协议 · 把范围限定在一个文件夹 · 文件夹里不含敏感文件
读取一份文件等于把它上传了出去,所以在使用像 Claude Code 这样的代理之前,先确认数据处理协议,把它指向单独一个文件夹,并确保这个文件夹里没有任何可能识别服务对象身份的内容。
  • 一个只会回答问题的助手,和一个会采取行动的助手不一样。代理(agent)可以执行一次搜索、读取结果、填写表单、浏览一组网站,或者执行一连串步骤来完成一项任务,并根据上一步返回的结果来选择下一步该做什么。
  • 这些代理式工具大多是开发者软件。Claude Code、OpenAI Codex 和谷歌的 Gemini CLI 会在终端里对你设备上的文件采取行动,GitHub Copilot 可以把一项描述过的任务变成一份草稿,像 ChatGPT 的 agent 模式这样的浏览器代理会点击浏览网站,而基于 Model Context Protocol 构建的连接器能让助手访问日历或数据库。在非营利机构里,这些通常由 IT 部门设置和限定范围。
  • 服务对象数据是否安全,取决于账户版本,而不是品牌。免费版和消费级版本常常会用你输入的内容做训练;只有书面承诺不会用你输入的内容做训练的商业版、企业版或 API 版,才适合接触服务对象信息,涉及健康相关内容时还需要签署协议。
  • 代理最能帮上忙的,是那些结果清晰、可核查的重复性多步骤行政工作:比如从可信网站汇编一份资源清单初稿,或依据一张表格填写重复性的模板,并始终由一个人核对输出结果。
  • 当一个代理读取一份文件时,这等同于把它上传到了供应商的数据中心,所以把代理指向一份服务对象文件,就意味着这份文件已经脱离了你的掌控;当它在一条正在使用的真实记录里操作时,风险更高,因为一步错误就是一个真实发生的动作。
  • 在工作中使用代理式工具之前,先确认你所在机构与供应商之间有数据处理协议,把它指向一个不含任何服务对象身份信息的单独文件夹,并让一个人来批准每一个有实质影响的步骤。
  • 善用这些工具的非营利机构,会始终让一个人参与其中:让 AI 产出翻译或摘要的初稿,再由工作人员来修正,并把高风险的工作留给合格的专业人员来完成。

它是如何运作的,又会在哪里出错

模型能够调用工具,并读取返回的结果

一个普通的聊天机器人只会产出文字。代理则是同一个模型接上了它可以调用的工具——网络搜索、表单填写工具、一段代码——并被赋予了判断何时调用哪个工具的方式。模型写出一个结构化的请求,工具执行后,结果又被反馈回模型去读取。语言模型可以被训练来决定调用哪个工具、什么时候调用,以及要传给它什么参数(Schick 及同事,2023)。正是这一点,让代理能够去查一件事、依据答案采取行动,并不断推进下去,而不需要你亲自驱动每一次点击。

它推理、行动、读取结果,然后继续下去

代理在一个循环里工作。它推理下一步该做什么,采取一个行动,读取这个行动返回的结果,并据此判断接下来的一步,如此循环,直到它判断任务已经完成。以这种方式把推理和行动交替进行——模型做出计划、调用工具,再根据观察到的结果做出调整——正是这类系统执行多步骤任务的方式(Yao 及同事,2023)。这个循环正是它有用之处的来源,同时也是代理走的路径难以提前预判的原因。

一步错,步步错

因为每一步都把上一步的输出当作自己的输入,一个早期的错误不会停留在原地,它会成为之后一切的起点。一项关于 transformer 在多步骤任务上表现的研究发现,随着步骤数增加,准确率急剧下降,错误沿着链条不断累积(Dziri 及同事,2023)。这种效应也直接体现在对代理的测试中:在一项针对使用工具的代理的基准测试中,表现最好的模型完成的任务也不到一半,而在同一项任务的八次独立尝试中全部成功的比例不到四分之一(Yao 及同事,2024)。对机构工作而言,这正是为什么每一个有实质影响的行动都需要一个人来批准:在第一步就被发现的一个错误数字或一条被误读的规定,永远不会有机会在第五步驱动一次表单提交。

代理可能被它读取的内容劫持

代理会读取你指向的任何内容,而它无法可靠地区分你的指令和嵌入在一份文档、一封邮件或一个网页里的文字。这个漏洞被称为提示词注入(prompt injection),在这类应用的安全风险中被列为第一位,因为代理仅仅是打开一份文件,其中隐藏的指令就可能让它改变行动方向(OWASP,2025)。这不是纸上谈兵。在一起已披露的事件中,一封精心构造的邮件让一个企业 AI 助手在用户没有点击任何东西的情况下泄露了内部文件;在另一起事件中,一个代理删除了一个正在运行的生产数据库。安全的做法是:绝不让同一个代理同时具备接触服务对象隐私数据、暴露于不可信内容,以及向外发送信息的能力。

一组可信网站 一份需要你核实的初稿清单
从可信网站汇编一份资源清单初稿

只使用我列出的这些网站,为我说明的需求汇编一份资源清单初稿。对每一条,给出机构名称、服务内容、联系方式、你所依据的来源页面,以及页面显示的最后更新日期(如果有的话)。标出任何网站内容不清楚、或你需要猜测的条目,并且不要添加我给出的网站以外的任何内容。 [说明需求并粘贴可信网站,不含服务对象身份信息]

安全提醒。 代理可能读错一个页面,或提取一条过时的信息,所以在任何人依赖它之前,打开每一个来源核实每一条内容。参见 模块 1

一项你可能交给代理去做的任务 一份标出人工审核点的计划
在让代理运行之前,先定好需要审核的节点

我正在考虑让一个 AI 代理来完成我描述的这项任务。把任务拆解成若干步骤,并针对每一步说明它是否足够低风险、可以自行运行,还是它会执行一个需要有人先批准的动作,比如发送消息、提交表单,或更改一条记录。指出早期的一个错误可能会悄悄带入后面哪些步骤。 [描述任务以及它会接触到的系统]

安全提醒。 只让代理自行运行低风险的步骤,让一个人来批准每一个作用于真实记录或发送正式内容的步骤。参见 模块 4

一项重复性的文件或数据琐事 一次代理先展示计划、后行动的演练
让代理在改动任何内容之前先展示它的计划

在你改动任何内容之前,先给我看你计划采取的完整行动清单,并等待我的批准。只在我指向的这一个文件夹里工作,把它当作一份副本,绝不要碰原始文件。 [让 IT 部门在一个不含敏感信息的文件夹副本上运行这个]

安全提醒。 代理对文件采取行动可能造成实际损害,所以要在副本上运行,要求它先给出计划,并让服务对象记录的唯一副本保持在它接触不到的地方。参见 模块 4

实例分析

一条错误的条目,在扩散之前被发现

  1. 一位个案工作者让一个代理从四个可信网站汇编一份资源清单初稿,并要求为每一条注明来源页面。
  2. 这个代理返回了一份整洁的清单,列出了十几家机构,每一家都附有服务内容、电话号码和链接,读起来像是已经完成的成果。
  3. 核对来源时,这位个案工作者发现有一条内容是代理读错了页面,附上了错误的资格规则,而后面还有两条内容重复了这条同样的错误规则,因为代理把它先前的误读带到了后面的条目里。
  4. 他们纠正了这条误读的内容,修正了受它影响的另外两条,并对照所引用的页面核实了剩下的部分,让代理继续负责起草,自己继续负责批准任何服务对象将据以行动的内容。

安全提醒。 不要让代理在没有人逐步审核的情况下处理真实的服务对象记录或提交任何正式内容。参见 模块 1模块 4。在采用代理式工具之前,先用 负责任地选择工具 走一遍评估;如果想用更低风险的方式复用一套设置,请参见 建立自定义助手

来源
  1. Schick, T., Dwivedi-Yu, J., Dessi, R., Raileanu, R., Lomeli, M., Zettlemoyer, L., Cancedda, N., & Scialom, T. (2023). Toolformer: Language models can teach themselves to use tools. In Advances in Neural Information Processing Systems 36. https://arxiv.org/abs/2302.04761
  2. Yao, S., Zhao, J., Yu, D., Du, N., Shafran, I., Narasimhan, K., & Cao, Y. (2023). ReAct: Synergizing reasoning and acting in language models. In The Eleventh International Conference on Learning Representations (ICLR). https://arxiv.org/abs/2210.03629
  3. Dziri, N., Lu, X., Sclar, M., Li, X. L., Jiang, L., Lin, B. Y., West, P., Bhagavatula, C., Le Bras, R., Hwang, J. D., Sanyal, S., Welleck, S., Ren, X., Ettinger, A., Harchaoui, Z., & Choi, Y. (2023). Faith and fate: Limits of transformers on compositionality. In Advances in Neural Information Processing Systems 36. https://arxiv.org/abs/2305.18654
  4. Yao, S., Shinn, N., Razavi, P., & Narasimhan, K. (2024). tau-bench: A benchmark for tool-agent-user interaction in real-world domains. arXiv. https://arxiv.org/abs/2406.12045
  5. OWASP. (2025). OWASP Top 10 for large language model applications. https://genai.owasp.org/llm-top-10/