科技

AI代理上线前先收权:八项检查堵住工具滥用与数据外泄

|作者: QUASA 编辑团队|2 分钟阅读| 2
AI代理上线前先收权:八项检查堵住工具滥用与数据外泄

AI代理上线前,应先把它能调用的工具、可访问的数据、授权有效期和自主执行范围压到完成任务所需的最小集合,再验证外部内容无法改变授权结果。真正有效的门禁必须由工具网关、身份系统、策略引擎、沙箱和审批服务强制执行;提示词可以表达行为约束,却不能充当访问控制。

可执行的评审包含八项检查:工具白名单、最小权限、外部输入隔离、短期凭据、人工审批、记忆隔离、结构化日志和对抗测试。每项都要提交可复核证据;只回答“已经考虑”或展示一段系统提示词,不能视为通过。

先定发布规则:模型提议,基础设施裁决

代理安全不需要抛弃传统控制,但要把它们调整到“模型能够规划并调用软件功能”的新边界。NIST汇总的业界意见 认为,基础网络安全原则仍然适用,但需要针对AI代理的新型威胁作出调整。

发布评审应采用默认拒绝、证据放行:代理输出只是动作提案,执行层仍要独立校验调用者、会话、工具、目标资源、参数和审批状态。模型生成的“风险较低”“用户已经同意”或“这是紧急任务”,都不能自行提高权限。

  • 每项控制要有负责人、策略版本和可重复的验证步骤。
  • 缺少证据、测试无法复现或控制只存在于提示词中,均按未通过处理。
  • 尚未消除的风险要记录影响范围、补偿控制、接受人和复审期限。

检查一至三:锁定工具、权限与外部输入

AI代理读取外部文档后调用未授权网络工具,工具网关按白名单拒绝执行

一、工具白名单。验证问题是:每类代理和每个信任级别究竟需要哪些工具,未登记工具是否会被执行层拒绝?合格证据包括版本化工具清单、工具定义摘要、所有者、允许环境和禁用记录,并附一次调用非白名单工具后被拒绝的日志。失败示例是开发阶段接入的文件删除、任意URL访问或通用命令工具仍留在生产配置中,只靠提示词要求代理“不要使用”。

二、最小权限。验证问题是:工具能否缩小到只读或有限动作,并限制资源、租户、路径、网络目的地和参数范围?合格证据包括IAM策略、工具网关规则、只读数据库账户,以及跨租户访问和越权写入被拒绝的结果。失败示例是为了汇总邮件而授予发送、删除和整个邮箱访问权,或让面向客户的代理继承运维人员权限。

三、外部输入隔离。网页、邮件、附件、检索文档和工具返回值都应视为不可信数据,而不是更高优先级指令。OWASP的提示注入防护清单 列出了间接注入、编码混淆、伪造工具观察结果和RAG污染等路径,并建议隔离不可信内容、按用户与会话权限校验工具调用及验证工具参数。

这一项要验证:含有指令、隐藏文本或恶意链接的外部内容,是否可能直接进入具有执行权的上下文?合格证据包括输入来源标签、净化记录、结构化数据边界、输出模式校验,以及“读取恶意文档后仍无法发信或上传数据”的测试结果。失败示例是把网页正文与系统指令拼成同一段文本,随后允许模型把网页指定的地址直接传给网络工具。

检查四至六:限制凭据、审批和记忆

AI代理的高风险删除操作等待参数绑定审批,参数改变后原批准自动失效

四、短期凭据。验证问题是:代理每次任务取得的凭据或授权材料是否限时、限域、限动作,并能在任务结束或异常发生时撤销?合格证据包括签发策略、受众和作用域限制、过期时间、密钥托管方式及撤销演练记录。失败示例是把长期API密钥放进提示词、环境快照或持久记忆,让多个用户会话共用同一高权限身份。

五、人工审批。验证问题是:哪些删除、付款、权限变更、代码执行和外部通信必须由人确认,审批是否绑定具体操作者、工具、目标、参数和有效期?合格证据包括动作分级表、执行前预览、审批人身份、不可复用的批准标识,以及参数修改后原批准自动失效的日志。失败示例是只弹出笼统的“允许继续吗”,批准后代理仍能更换收件人、金额或删除范围。

六、记忆隔离。验证问题是:不同用户、租户和会话的记忆能否互相读取,未经校验的内容能否长期保存?合格证据包括命名空间或访问策略、写入前分类与净化、敏感字段脱敏、加密和保留期限,以及跨租户读取、污染写入与到期清除测试。失败示例是把用户原文和工具输出直接写入共享向量库,使恶意指令在后续会话中再次被检索并影响动作。

检查七至八:让异常可追溯、绕过可复现

对抗测试向指定版本AI代理注入多类攻击,执行层阻断危险调用并留下完整记录

七、结构化日志。验证问题是:一次高风险动作能否从用户请求追溯到模型提案、授权判断、人工审批、工具参数和执行结果,同时避免把凭据或个人数据明文写入日志?合格证据是一条经过脱敏的完整追踪记录,包含代理与会话标识、工具名、动作等级、授权结果、审批标识、策略版本、时间和执行结果;还要展示针对审批绕过、权限提升和异常调用频率的告警。

八、对抗测试。测试不能只确认模型是否会说“不”,而要观察执行层是否真的拒绝危险动作。OWASP的AI代理安全清单 把提示覆盖、工具滥用、权限提升、记忆污染、数据外泄、审批绕过和多代理越界列入可重复测试,并要求在提示词、工具、记忆、检索、策略或模型提供方发生实质变化后重新验证。

合格证据要记录被测代理版本、模型提供方、工具策略、检索配置、攻击输入、预期结果和实际结果,并把历史失败加入回归套件。失败示例是只保存模型回复截图而没有工具网关日志,或者工具权限已经扩大,却仍沿用旧报告批准发布。

把八项检查变成可签署的上线门禁

评审表不能只设“是/否”。每一项至少填写控制状态、证据位置、验证人、验证日期、失败影响和整改负责人,使架构师能够核对设计,使安全负责人能够复现拒绝结果,使发布负责人能够据此作出决定。

  1. 逐项提交策略文件、配置快照、脱敏日志或自动化测试报告,口头说明不能替代证据。
  2. 在与生产相同的身份、网络和工具边界中复现允许与拒绝路径,避免只在没有真实权限的演示环境测试。
  3. 只要非白名单工具仍可调用、低权限会话能够越权、外部内容可驱动高风险动作、审批可绕过或跨租户数据可读,就阻断发布。
  4. 把工具定义、权限范围、凭据策略、审批逻辑、记忆结构或模型配置的变化设为重新评审触发条件。

最终签署的不是“模型足够听话”,而是即使模型受到误导、生成错误计划或反复请求高权限操作,基础设施仍会把动作限制在已授权边界内。八项控制都有可复核证据,才满足进入生产环境的基本安全门槛。

分享:

订阅我们的新闻通讯

将最新 Web3、AI 和加密货币新闻直接发送到您的邮箱。

0