在放手让 AI 智能体自主行动之前,先验证九道防护栏。前四道把智能体能执行的每个动作都映射到一个风险评级,这样那些不可逆、敏感且代价高昂的动作总会暂停下来,交给人。后五道则确认当过滤器被骗过时,用来约束智能体的环境:唯一的智能体身份、最小权限、沙箱、受限的网络出口,以及动作级别的审计日志。动作映射告诉你什么可以安全地交给自动化处理。而真正守住底线的是环境,因为大多数清单所依赖的内容过滤器,恰恰就是在最关键时刻会失效的那一层。把这九道全部当成“是或否”的问题来回答,只要有任何一项的答案是“否”或者“我们不确定”,这个智能体就还不能在无人监督的情况下运行。

这是我们在让自己搭建的智能体在另一家公司内部自主行动之前所做的上线前审核,写法力求让一位非技术背景的负责人也能照着自己跑一遍,无论是针对自家智能体还是供应商的智能体。如果你更希望我们替你来做,可以看看我们如何运营负责任的 AI 治理与风险管理。下面这一切都任你使用。

我该怎样使用这份清单?

把它当成飞行前检查,而不是一套哲学。拿上你即将部署的那个智能体(或者供应商正向你推销的那个),对九项中的每一项都给出一个干脆的“是”或“否”。“基本上算是”就等于“否”。目标是在智能体接触到任何真实事物之前,把缺口暴露出来。

这九项分成做不同工作的两组:

  • 第 1 到第 4 项(动作映射)。 这些决定了智能体可以不经询问就做什么,以及哪些必须为人停下来。这是对风险的判断,也是大多数指南会覆盖的部分。
  • 第 5 到第 9 项(环境)。 这些限定了智能体根本上能触及和执行的范围,无论它被告知去做什么。这是大多数清单略过的部分,也是当过滤器被骗过时真正约束住智能体的部分。

两组都重要,但它们失败的方式不同。动作映射关乎“判断正确”。环境关乎“在判断错误时还能挺住”。两者你都需要,因为没有哪个过滤器能拦住一切:Anthropic 在生产环境中使用的自动模式分类器,已属业内最好之一,但即便调到几乎从不拦截合法指令,它对智能体过度积极的动作仍会漏掉约 17%。有另一层在后面兜底时,17% 的漏判率没问题;可一旦它是智能体和你的钱之间唯一的屏障,那就太鲁莽了。

第 1 到第 4 项:你是否把每个动作都映射到了风险评级?

你没法约束自己没有列出来的东西。先从写下智能体能执行的每一个动作开始,然后逐一评级。OpenAI 的智能体指南给出了最清晰的评级方法:从四个维度把每个动作评为低、中或高。

维度要问的问题高风险信号
写入权限它只是读取,还是会改动什么?它会写入、发送或删除
可逆性结果能不能被撤销?它无法被收回
账户权限它需要什么访问权限才能做这件事?管理员、财务或客户数据范围
财务影响出错时代价是什么?真金白银,或失去信任

防护栏 1:你是否列出了每一个动作,并把它评为低、中或高? 如果清单上有哪个动作没人评级,那个就是会伤到你的那个。评级几乎能把一切归入三个类别:

风险示例规则
低(只读、可逆)查询一笔订单、概括一张工单、起草一条回复让它运行。记录日志。事后审查。
中(会写入,但可恢复)更新一条记录、发布一条内部备注、创建一份草稿在严格的限度内允许。提醒一个人。
高(不可逆、敏感、代价高昂)退款或付款、删除记录、授予访问权限、发送对外消息在运行前要求人工批准。始终如此。

防护栏 2:每一个高风险动作在运行前是否都会暂停,等待明确的人工批准? 这是防止最糟糕后果的那条唯一规则。OpenAI 点名的正是这些需要人工签字的动作:取消订单、授权大额退款,以及发起付款。再加上删除、授予访问权限,以及任何离开公司的消息。一个退款智能体想读多少订单都行,但只要超过一个很小的阈值,它就绝不能在没有人点击“批准”的情况下动钱。

防护栏 3:审批关卡是否足够稀少,让人们仍会去看它? 陷阱在于让智能体事事都问。这么做,你建出来的是一个更糟的系统,而不是更安全的系统。Anthropic 测得用户对大约 93% 的权限提示都会批准,所以一道一天触发四十次的关卡就是表演:人名义上在环里,实际上已经不看了。要验证三件事:智能体只在真正有风险的动作上提示、提示用大白话说明后果(“向账户 X 退款 1,000 美元”),并且沉默默认为“否”,永远不是“是”。

防护栏 4:当智能体不断失败时,它是否会停下来求助? 一个困惑的智能体陷在重试循环里,本身就是一种风险。设一个失败阈值,让智能体在尝试失败达到设定次数后停下并上报,而不是空转。OpenAI 列出的人工介入触发条件恰好是两个:超过失败阈值,以及高风险动作。这两个你刚好都覆盖到了。

第 5 到第 9 项:你是否验证了约束它的环境?

这就是通用清单略过的部分,也是真正挑大梁的部分。第 1 到第 4 项假设智能体判断正确。第 5 到第 9 项假设它有时不会,并在那种情况发生时把损失控制住。

这一组之所以重要,源于智能体安全里最被低估的一个事实:当有害指令看起来很合法时,内容过滤器恰恰会失效。Anthropic 做过一个测试,让一名员工被钓鱼,于是恶意指令是从智能体本该服务的那个可信用户那里发出来的。在 25 次重试中,智能体有 24 次完成了凭据窃取,因为用他们的话说,当指令是用户亲手敲入的,分类器就没有任何异常可抓。唯一能可靠地阻止它的办法是环境层面的:封锁智能体的网络出口,让被窃的数据无处可去。过滤器在猜意图。环境则直接拿掉能力。能力才是你真正能控制的东西。

防护栏 5:智能体是否有自己的身份,而不是共用一把管理员密钥? 每个智能体都应在唯一的身份下运行,绝不共用凭据,也绝不使用某个人的管理员登录。共用密钥意味着你无法分辨是哪个智能体做了什么,而一旦被攻破,影响会蔓延到这把密钥所能触及的所有地方。唯一的身份也正是让防护栏 9 里的审计日志变得有意义的前提。

防护栏 6:那个身份是否被收紧到了最小权限? 智能体只拿到它的工作真正需要的、最窄的一组权限,多一分都不给。一个负责退款的客服智能体,不应该同时还能导出你的客户数据库或修改薪资。一旦它被骗,损失受限于它被授予了什么,而不是过滤器有没有抓住那个骗局。用能跑得通的最弱访问权限:只读胜过读写,能读写但不能删除胜过完全访问。

防护栏 7:智能体是否运行在沙箱里? 智能体应在一个隔离环境中运作,这个环境建立在成熟、久经考验的隔离机制之上(也就是那些用来运行不可信代码的容器和沙箱),而不是自己手工搭出来的东西。正如 Anthropic 所指出的,那些底层原语经受过的对抗性审视,远比你自己造的任何东西都多。也要让约束程度与用户相匹配:一个能读取并运行代码的开发者,和一个做不到这些的客服,并不是同一种威胁模型;工具越强大,盒子就要扎得越紧。

防护栏 8:智能体的网络出口是否受限,并按能力划定了范围? 这正是阻止上面那次钓鱼攻击的控制。但单靠一份“允许的域名”清单还不够。Anthropic 吃过亏才学会:攻击者通过把文件转发到自己在某个被允许域名上的账户,从那个域名把数据偷运了出去。所以要把出口规则当成能力授予(允许智能体做什么)来想,而不只是一份它可以访问的地址清单。

防护栏 9:是否对每个动作都做了动作级别的审计日志? 你看不见的东西,就治理不了。智能体执行的每一个动作,尤其是高风险的那些,都应被记录下来,且细节足以重建发生了什么、由谁或由什么触发,以及它动了哪些东西。动作级别的日志,是你在一个缓慢的问题变成头条之前就抓住它的方式,也是你随时间推移收紧其余八道防护栏的方式。

完成后的清单长什么样?

下面把九项放在一处,每一项都写成你可以验证的“是或否”。一个“否”是上线前要补上的缺口,而不是一条脚注。

#防护栏满足以下条件即可上线
1动作清单与风险评级每个动作都已列出,并评为低、中或高
2高风险动作的人工关卡每个不可逆或代价高昂的动作都会暂停以待批准
3稀少、用大白话的审批关卡只在真正有风险时触发,且默认为“否”
4失败阈值上报智能体在反复失败后停下并求助
5唯一的智能体身份智能体有自己的身份,不共用管理员密钥
6最小权限它只能触及工作所需的范围
7沙箱它运行在成熟、隔离的基础设施中
8受限且按能力划定范围的出口网络访问被围住,而不是一份开放的允许域名清单
9动作级别的审计日志每个动作都被记录且可供审查

注意这里的结构。前四项是你针对风险做出的决策;后五项是你建进环境里的控制。前四项可以被骗过。后五项没法被说服不去履行职责,这也是为什么即便模型再优秀,它们依然不可妥协。

我该如何拿这份审核去检查供应商的智能体?

同样这九个问题,用在别人的智能体上一样好使,而且它们是分辨“被约束住的产品”和“信心十足的演示”最快的办法。演示只能证明智能体在好日子里能用。清单证明的是它在坏日子里会发生什么。

请供应商用大白话回答这些问题:

  • 我的哪些动作在运行前需要人工批准? 一个连它们都说不出来的供应商,根本没给它们评过级。
  • 智能体是拿到自己的、按最小权限授予的身份,还是用一把通向我系统的共用密钥? 后一种答案是个危险信号。
  • 它有沙箱吗,它在网络上能触及什么? “它能上网”不算回答。
  • 每个动作都有日志吗,我能看到这些日志吗? 如果你审计不了它,你就治理不了它。
  • 一旦智能体被骗,影响范围有多大? 诚实的回答是一份它能触及什么的清单,而不是一句“它绝不会被骗”的承诺。

如果回答含糊,或者完全停留在“模型表现很乖”,那不管演示看起来多漂亮,这个智能体都没有被约束住。一个好的供应商会备好答案,因为这些正是他们本该问过自己的问题。

为什么这件事现在很重要?

因为那些通过这份审核的团队和那些跳过它的团队,两者之间的差距即将体现在数字上。Gartner 预计到 2027 年底,超过 40% 的智能体式 AI 项目会被取消,原因之中就点名了风险控制不足;并预测到 2028 年,25% 的企业生成式 AI 应用每年将至少发生五起轻微安全事件,而 2025 年这一比例为 9%。防护栏正从一个配置项变成一块有预算的控制平面,而上面这份审核,就是你在这场转变中站对一边的方式。

令人鼓舞的是,这些都不玄乎。把每个动作映射到一个风险评级,并把不可逆的拦住。给智能体一个属于它自己的身份,配上它所需的最小访问权限,放进沙箱,把网络围起来,并记录每一个动作。让人工关卡足够稀少,使人们仍会去看它。做到这些,一个溜过你过滤器的攻击者,照样会撞上一堵他从未被授予的能力之墙。

如果你希望在第一个智能体上线之前,由我们替你把这九道防护栏搭好、验证好、运行好,那正是我们在别家公司技术栈里所做的工作。在下方预约一次免费咨询,我们一起拿这份清单来检查你的智能体。