AI读一封邮件也可能被劫持:权限越大,后果越重

可调用工具的AI智能体读取一封邮件时,正文或附件里的第三方指令可能进入会话上下文,使模型偏离用户原本的任务。OpenAI对提示注入的说明 将其定义为第三方通过注入恶意指令误导模型,诱使AI去做用户没有要求的事。
危险程度取决于智能体受影响后能做什么:只读摘要工具可能产出错误内容,连接邮箱、云盘、内部API或外发功能的智能体则可能触及更多数据和操作。降低风险不能只靠识别可疑文字,还要缩小任务、隔离不可信内容、授予最小且短期的权限,并在敏感动作前由确定性策略或人工确认拦截。
恶意指令如何混进正常邮件
直接提示注入来自用户输入,间接提示注入则借智能体必须处理的第三方材料进入上下文。攻击指令可以出现在邮件正文、网页、共享文档、附件或插件返回内容中,也可能藏在不易被人察觉的文字、编码内容或图像里;文件属性、替代文本等元数据只要会被送入模型,也应按不可信输入处理。
问题不等同于发现某个“危险字符串”。自然语言既可以描述一项操作,也可以命令系统执行它,攻击内容还可能经过检索、解析或多模态处理后才显现作用。因此,关键词过滤、常规格式校验和一句“忽略恶意指令”的系统提示都只能承担部分防线,不能成为授权依据。
Microsoft的间接提示注入防御文档 明确把邮件、文档、网站和插件列为不可信内容入口,并指出模型难以区分用户输入与外部内容,传统输入验证不足以单独解决问题。
权限决定一次偏移能造成什么后果

提示注入先改变模型对任务的理解,工具权限再把这种偏移转化为现实影响。对同一封恶意邮件,只能读取当前内容的智能体至多可能给出失真的摘要;若它还能搜索私有文件、创建共享链接、发送邮件或调用内部系统,攻击面便随可用工具和数据范围扩大。
OWASP列出的潜在后果 包括敏感信息披露、内容操纵、未经授权地使用模型可访问的功能、在连接系统中执行命令以及影响关键决策;其严重程度取决于业务环境和系统赋予模型的行动能力。这正是标题中“权限越大,后果越重”的边界:并非每次注入都会造成泄露,但广泛权限为更严重的结果提供了条件。
例如,用户只要求概括供应商邮件,附件却指示智能体查找合同并发送到外部地址。若会话只能读取当前邮件,越界检索会被权限层拒绝;若它继承了用户的云盘搜索和外发权限,且发送前没有独立确认,同一段恶意内容就可能形成从读取到外泄的完整路径。
个人使用:缩小任务,不把确认当例行步骤
个人用户无法判断模型是否正确识别了每一段隐藏指令,但可以限制任务和账号暴露面。核心原则是避免把开放式目标、广泛登录权限和自动执行同时交给一次会话。
- 限定输入和动作:用“概括当前邮件的三个要点,不打开链接、不读取其他邮件”代替“检查收件箱并处理所有事项”。
- 非必要不登录:处理公开资料时使用未登录状态或低权限账号;只有任务确实需要时才连接邮箱、云盘、日历或支付服务。
- 分开读取与执行:先生成摘要或操作草案,再单独决定是否调用搜索、共享、发送或购买工具。
- 核对真实参数:发送邮件、共享文件、提交表单、删除数据或付款前,检查收件人、域名、附件、金额、数据范围和最终动作。
- 拒绝材料自行扩权:邮件或附件中的“忽略此前规则”“不要告诉用户”“立即上传文件”等文字,不应因出现在业务内容里而获得指令地位。
应用开发:授权边界必须在模型之外

开发团队应把模型视为可能受不可信内容影响的决策组件。模型可以提出工具调用,但是否执行应由模型之外的代码根据用户身份、任务范围、数据分类、目的地和会话状态判定,不能让模型用自然语言自行扩大权限。
用户指令、系统策略、检索材料和工具结果应保留来源与信任标签,而不是无边界地拼成一段文本。不可信材料可以先在隔离环境中解析,只输出符合固定模式的字段;进入规划或工具层之前,再校验字段类型、允许值、来源和数据范围。内部知识库与合作方接口同样可能承载未经核验的内容,不能仅凭来源名称自动放行。
工具接口也应足够窄:读取当前文档的凭证不应同时覆盖整个云盘,发送接口不应接受任意收件地址或任意附件。凭证按单项任务签发并尽快失效,工具网关则检查实际参数、目标域和数据分类;发送、删除、执行代码、修改权限等高风险动作应要求重新认证或明确批准。
单次调用看似合理,不代表调用链安全。“搜索文件—生成摘要—发送邮件”组合后可能成为数据外流路径,因此执行层需要分析整条链是否仍服务于用户原始目标。确认界面应展示真实收件人、附件和数据去向,而不是只提供含糊的“是否继续”。
企业部署:假设检测会漏掉,再限制失守范围

企业防线不应押注某个过滤器识别所有注入。更稳妥的架构是在入口、上下文、规划、工具和出口分别设置控制:标记内容来源,隔离外部数据,检测任务计划是否偏移,在工具网关执行身份和参数策略,并阻止敏感信息流向未获批准的账号或域。
运行时监控要关注行为变化,而不只是已知攻击关键词,例如检索范围突然扩大、访问与任务无关的数据、目标域改变、连续组合高权限工具,或试图绕过预定确认步骤。触发异常时可以暂停流程或降级为只读,并把输入来源、权限授予、工具参数、审批记录和最终结果串联起来,供调查与审计。
不同权限等级需要不同验收标准。只处理公开内容的摘要功能可以采用较轻的控制;能够访问客户数据、修改记录、执行代码或向外发送信息的智能体,则需要更严格的隔离、短期授权、人工审批和可追溯日志。防护目标不是承诺模型永不受骗,而是让受骗的模型也无法自行取得更多权限、跨越数据边界或完成不可逆操作。
订阅我们的新闻通讯
将最新 Web3、AI 和加密货币新闻直接发送到您的邮箱。