Microsoft:ASCII smuggling 从 AI prompt injection 走向 phishing filter evasion

Microsoft 发现攻击者把 AI prompt injection 常见的 invisible Unicode tag characters,插入 finance-themed phishing 关键词,让邮件过滤器及部分 ML pipeline 更难直接匹配。

Microsoft Security Blog 于 2026 年 9 月 3 日披露一个值得关注的跨域变化:原本在 AI prompt injection 研究中用来把指令藏在文字里的 ASCII smuggling,已经被攻击者改用来逃避传统 phishing filter。这次 Microsoft 观察到的邮件,并不是把隐藏指令交给 AI,而是把 invisible Unicode tag characters 插入金融诱饵词语,让检测器看到的字符串不再完整。

ASCII smuggling 主要使用 Unicode Tags block U+E0000 至 U+E007F。这些 code point 通常不会在一般字体和界面中显示,但会保留在原始文字里,也可以被 language model 或其他 parsing software 读取。Microsoft 以 U+E0041 对应字母 A、U+E0061 对应 a 作说明;真正的风险在于人眼看到的内容和模型或 filter 收到的内容可能不同。

在 AI security 研究里,典型攻击是把 instruction 藏在网页、文档或 email,让人看不到而让 AI assistant 读取。这次 phishing campaign 反过来使用同一种文字层技巧:把一个像 funding 的字切成 fun、不可见字符、ding。对收件人来说仍然像正常词语,但对只做 literal match 或没有先 normalization 的 signature,原本的连续关键词已经不存在。

Microsoft 的 detection 起点来自 Defender for Office 365 的 prompt-injection protection research。第一版 signature 只要看到 U+E0000 至 U+E007F 就告警,但很快发现 England、Scotland 和 Wales 的 subdivision flag emoji 本身也使用 tag characters,因此要先排除合法 emoji,再把剩余信号和 sender、domain、URL 及行为模式结合。

Microsoft telemetry 显示,signature hits 在 2026 年 2 月 9 日急升,2 月 11 日超过 230 万封;研究团队把活动聚成大约 150 个 finance-themed sender domains,并观察到严格的 weekday-on、weekend-off 节奏。这个特定 tag-character 使用阶段在 5 月 15 日后急跌,低量残余延续到 6 月中。这是 Microsoft telemetry 中一个 campaign phase 的时间范围,不等于整个 phishing campaign 的完整生命周期。

Microsoft 也强调,大部分邮件不是靠单一 Unicode signal 才被拦截,超过 99% 的消息由 sender、IP、URL、domain reputation、ML phishing classification、brand impersonation、authentication 和其他 layered protection 标记。这一点很重要:ASCII smuggling 可以揭示 detection gap,但不能自动推论所有 filter 都会被同样方式绕过。

防守原则可以浓缩成 normalize before you match:在做 keyword、signature 或 regex 检查前,先剥除或折叠 Unicode tag characters 及其他 invisible code points;同时把 tag-block 出现视为 anomaly signal,再按 finance-themed domain、bulk 行为和 email infrastructure 作交叉验证。相同 normalization 也应放在 AI ingestion 之前,减少 email 内容把隐藏指令带入 assistant 的机会。

这次研究的价值,是说明 AI security 技巧不会永远留在 AI 产品内。当 prompt injection 的文字操控方法被 threat actor 借用到 phishing,防守方需要同时理解 Unicode、tokenization、email filtering、ML classifier 和 agent ingestion。对于企业,最稳妥的方向不是寻找一个神奇 signature,而是把 normalization、OCR、reputation、authentication、AI prompt-injection protection 和人工调查组成多层 pipeline。

MODULE.002 //

更多 Insights

分享网站、AI automation、数码营销、AI news 和 VMTS 公司新闻。