从可信网站汇编一份资源清单初稿
只使用我列出的这些网站,为我说明的需求汇编一份资源清单初稿。对每一条,给出机构名称、服务内容、联系方式、你所依据的来源页面,以及页面显示的最后更新日期(如果有的话)。标出任何网站内容不清楚、或你需要猜测的条目,并且不要添加我给出的网站以外的任何内容。 [说明需求并粘贴可信网站,不含服务对象身份信息]
安全提醒。 代理可能读错一个页面,或提取一条过时的信息,所以在任何人依赖它之前,打开每一个来源核实每一条内容。参见 模块 1。
This is a private beta prototype. Enter the password to continue. The content is unverified and must not be cited or relied upon.
Incorrect password. Please try again.
较新的工具不只是回答问题,它们会代表你执行多步骤的操作。这种能力很有用,同时也提高了风险。
一个普通的聊天机器人只会产出文字。代理则是同一个模型接上了它可以调用的工具——网络搜索、表单填写工具、一段代码——并被赋予了判断何时调用哪个工具的方式。模型写出一个结构化的请求,工具执行后,结果又被反馈回模型去读取。语言模型可以被训练来决定调用哪个工具、什么时候调用,以及要传给它什么参数(Schick 及同事,2023)。正是这一点,让代理能够去查一件事、依据答案采取行动,并不断推进下去,而不需要你亲自驱动每一次点击。
代理在一个循环里工作。它推理下一步该做什么,采取一个行动,读取这个行动返回的结果,并据此判断接下来的一步,如此循环,直到它判断任务已经完成。以这种方式把推理和行动交替进行——模型做出计划、调用工具,再根据观察到的结果做出调整——正是这类系统执行多步骤任务的方式(Yao 及同事,2023)。这个循环正是它有用之处的来源,同时也是代理走的路径难以提前预判的原因。
因为每一步都把上一步的输出当作自己的输入,一个早期的错误不会停留在原地,它会成为之后一切的起点。一项关于 transformer 在多步骤任务上表现的研究发现,随着步骤数增加,准确率急剧下降,错误沿着链条不断累积(Dziri 及同事,2023)。这种效应也直接体现在对代理的测试中:在一项针对使用工具的代理的基准测试中,表现最好的模型完成的任务也不到一半,而在同一项任务的八次独立尝试中全部成功的比例不到四分之一(Yao 及同事,2024)。对机构工作而言,这正是为什么每一个有实质影响的行动都需要一个人来批准:在第一步就被发现的一个错误数字或一条被误读的规定,永远不会有机会在第五步驱动一次表单提交。
代理会读取你指向的任何内容,而它无法可靠地区分你的指令和嵌入在一份文档、一封邮件或一个网页里的文字。这个漏洞被称为提示词注入(prompt injection),在这类应用的安全风险中被列为第一位,因为代理仅仅是打开一份文件,其中隐藏的指令就可能让它改变行动方向(OWASP,2025)。这不是纸上谈兵。在一起已披露的事件中,一封精心构造的邮件让一个企业 AI 助手在用户没有点击任何东西的情况下泄露了内部文件;在另一起事件中,一个代理删除了一个正在运行的生产数据库。安全的做法是:绝不让同一个代理同时具备接触服务对象隐私数据、暴露于不可信内容,以及向外发送信息的能力。
只使用我列出的这些网站,为我说明的需求汇编一份资源清单初稿。对每一条,给出机构名称、服务内容、联系方式、你所依据的来源页面,以及页面显示的最后更新日期(如果有的话)。标出任何网站内容不清楚、或你需要猜测的条目,并且不要添加我给出的网站以外的任何内容。 [说明需求并粘贴可信网站,不含服务对象身份信息]
安全提醒。 代理可能读错一个页面,或提取一条过时的信息,所以在任何人依赖它之前,打开每一个来源核实每一条内容。参见 模块 1。
我正在考虑让一个 AI 代理来完成我描述的这项任务。把任务拆解成若干步骤,并针对每一步说明它是否足够低风险、可以自行运行,还是它会执行一个需要有人先批准的动作,比如发送消息、提交表单,或更改一条记录。指出早期的一个错误可能会悄悄带入后面哪些步骤。 [描述任务以及它会接触到的系统]
安全提醒。 只让代理自行运行低风险的步骤,让一个人来批准每一个作用于真实记录或发送正式内容的步骤。参见 模块 4。
在你改动任何内容之前,先给我看你计划采取的完整行动清单,并等待我的批准。只在我指向的这一个文件夹里工作,把它当作一份副本,绝不要碰原始文件。 [让 IT 部门在一个不含敏感信息的文件夹副本上运行这个]
安全提醒。 代理对文件采取行动可能造成实际损害,所以要在副本上运行,要求它先给出计划,并让服务对象记录的唯一副本保持在它接触不到的地方。参见 模块 4。
安全提醒。 不要让代理在没有人逐步审核的情况下处理真实的服务对象记录或提交任何正式内容。参见 模块 1 和 模块 4。在采用代理式工具之前,先用 负责任地选择工具 走一遍评估;如果想用更低风险的方式复用一套设置,请参见 建立自定义助手。