新手入门

一封正常邮件藏着不可见字符:钓鱼开始借用AI攻击技巧

|作者: QUASA 编辑团队|2 分钟阅读| 2
一封正常邮件藏着不可见字符:钓鱼开始借用AI攻击技巧

微软于2026年9月3日披露,一场大规模金融主题钓鱼活动把因AI提示注入研究而受到关注的不可见Unicode Tags字符用于传统邮件检测规避。Microsoft Security Research公布的分析 显示,攻击者把U+E0020插入“funding”等诱饵词,让邮件在人眼看来正常,却破坏底层文本中的连续关键词。

这项披露分析的是已经发生并回落的攻击阶段,而不是9月3日才开始的新一轮投递。相关检测命中量从2026年2月9日陡增,高流量使用持续约三个月,并在5月15日后明显下降;更广泛的钓鱼活动早于这种字符手法出现,也没有随着它的减少而结束。

同一个“funding”,人、源码和过滤器看到三种结果

同一融资诱饵词在收件人界面、邮件源码和过滤器输入中呈现不同字符结构

本次活动使用Unicode Tags区间U+E0000至U+E007F中的字符。该区间包含与可打印ASCII字符对应的标签码点,通常不会被字体和邮件界面显示,但仍存在于原始文本及后续解析链路中。攻击邮件并未用这一范围编码完整的隐藏指令,而是把单个标签字符当作不可见分隔符。

一个不含恶意链接的条件示例可以说明三层差异:

  • 肉眼所见:正文显示“business funding available”,词语连续,收件人仅凭外观难以发现异常。
  • 邮件源码:实际字符序列相当于“fun<U+E0020>ding”,其中TAG SPACE位于字母之间;它不是普通空格,也不是可见的HTML标签。
  • 过滤器所见:未经预处理的字面规则找不到连续的“funding”,分词器也可能得到“fun”、异常码点和“ding”;若检测副本先移除该字符,完整单词才会恢复。

因此,将这次用法笼统描述为“在邮件中隐藏一段ASCII消息”并不准确。它借用了ASCII smuggling涉及的字符范围及人机显示差异,实际目的却是拆散高信号词,干扰关键词、正则表达式和部分文本分类流程。

简单匹配会漏掉,但多层网关不一定失守

多层邮件防护通过字符解析、信誉、认证、链接和分类信号共同拦截混淆邮件

不可见字符能否绕过检测,取决于处理顺序。如果网关先在原始码点上运行字面规则,插入物可能使匹配失败;如果先生成规范化检测文本,或从邮件渲染结果中通过OCR重新提取可见文字,规则仍可能识别原词。机器学习分类器同样不是天然免疫:异常码点可能改变token边界,但具体结果取决于模型、预处理和其他输入信号。

Xcademia对同一事件的技术梳理 指出,在Microsoft Defender for Office 365遥测中,超过99%的相关邮件由不依赖直接识别标签字符的其他防护层标记,包括发件人、IP、URL和域名信誉、邮件认证、品牌仿冒检测及机器学习分类。

这个比例不能外推到所有邮件系统,也不意味着单纯的关键词规则已经足够。它只说明在微软所观察的环境中,字符混淆没有同时消除发送基础设施、链接、批量投递和身份认证等信号;实际覆盖仍受产品许可、配置和可用遥测影响。邮件管理员需要验证自己的处理链路,而不能从产品是否使用AI推断防护结果。

检测重点是标签字符的位置,而非见到就拦截

邮件管理员区分合法分区旗帜字符序列与插入金融关键词的孤立U+E0020

CyberVeille的事件复核 记录了U+E0000至U+E007F检测范围,以及“fun<U+E0020>ding”这种把TAG SPACE放入金融关键词的模式。对邮件网关而言,最低限度的字符检查应覆盖整个Tags区,并对拉丁单词内部的孤立码点、重复插入和金融诱饵语境提高风险权重。

规则不能把区间命中直接等同于恶意。英格兰、苏格兰和威尔士的分区旗帜emoji会合法使用标签字符序列;安全网关、邮箱服务商以及转发测试样本的研究人员也可能产生相关命中。合理做法是识别完整、合法的旗帜序列并设置窄范围例外,同时保留对孤立TAG SPACE和异常位置的检测。

规范化也不应覆盖原始证据。系统可以保存未经修改的原始邮件,再生成单独的检测副本:先移除或折叠Tags字符及策略明确覆盖的零宽字符,再执行关键词、正则、分词和分类。这样既能恢复被拆散的词,又能在调查时看到原始码点、位置和数量。

中小企业邮件网关的最小检查单

这次事件需要核对的不是某个固定产品开关,而是邮件从接收、解析到判定的完整顺序。一个可执行的最小流程包括:

  1. 从主题、纯文本正文和HTML解析后的文本中提取Unicode码点,记录U+E0000至U+E007F及既有策略覆盖的零宽字符。
  2. 同时保存原始邮件与规范化检测副本;在副本中处理不可见字符后,再运行关键词、正则表达式、分词和分类规则。
  3. 用受控样本分别测试“funding”和“fun<U+E0020>ding”,确认两者触发一致的内容策略,并检查日志能否明确显示异常码点。
  4. 只为完整的合法标签序列设置精确例外,不要对白名单发件人全面放行Tags字符,也不要丢弃未经修改的原始证据。
  5. 把字符异常与发件域名和IP信誉、SPF/DKIM/DMARC结果、URL行为、批量投递节奏及用户举报关联,避免让单一字符信号承担最终判定。
  6. 如果邮件还会进入摘要助手、客服机器人或其他AI系统,应在模型摄取前执行同类扫描和规范化;邮件拦截与AI输入防护是两道不同控制。

目前可以确认的是,这一特定Unicode Tags手法的高流量阶段已在2026年5月中旬后回落,但背后的钓鱼活动仍会更换域名和规避方式。接下来真正需要验证的是:各邮件产品是否在内容规则之前处理不可见码点,管理员能否取得码点级日志,以及受控样本能否证明渲染文本、解析文本与检测输入得到一致判断。

分享:

订阅我们的新闻通讯

将最新 Web3、AI 和加密货币新闻直接发送到您的邮箱。

0