Context Collapse, Part 3 - AI Worming through Word

来源:En Klype Salt(2026-07-28),Håkon Måløy;MSRC 协调披露(144 天协调期),披露时漏洞类仍可利用,作者选择类级(class-level)披露。三部曲终篇,系列的理论核心。

编译摘要

1. 浓缩

  • 核心结论1:XPIA 可从单次沦陷升级为经正常文档工作流自传播的 AI 蠕虫,且披露时无稳健缓解
    • 关键证据: 外部文档中的隐藏指令(白字 + 8 号字体)使 Copilot for Word 篡改起草中的文档(PoC:财务数字全部减半)并把完整载荷以隐藏文本复制到产物中;第二阶段传播无需原始攻击文档参与(图 6/7),载体是"内部创建的可信文档",经 SharePoint/Teams 可跨组织扩散;两次修复(新编辑体验、模型升级至 GPT-5.5)均未关闭漏洞类,GPT-5.6 上完整复现;作者因协调期耗尽选择类级披露。
  • 核心结论2:漏洞是架构性的——"被检查的内容参与检查行为本身"
    • 关键证据: LLM 必须先处理外部内容才能判断其含义/相关性/是否含攻击,但做出判断时攻击者 token 已在参与产生该判断的计算;依赖模型检测 XPIA 等同于让解释器执行不可信程序来判断其是否安全;前置检测只是把问题外移——弱于目标的检测器必有盲区(表征空间更小),同等语义能力的检测器只能是另一个 LLM,形成 "LLMs all the way down";当前架构无法可靠分离 intention 与 interpretation,攻击者信息影响的不仅是模型产出什么,还有模型相信自己被要求产出什么。
  • 核心结论3:工程推论——假设某个沦陷率 + 用 provenance 保溯源
    • 关键证据: "任何把 LLM 集成进可信工作流的系统都必须假设攻击者内容进入上下文会以某个速率导致沦陷";缓解建议:生成文档在元数据中保存来源材料与模型编辑的 provenance——不防注入,但恢复溯源能力(篡改经合法工作流产生、Copilot 编辑批准后不可见,溯源极难)。

2. 质疑

  • 关于"结论1"的质疑: 自动传播路径("Edit with Copilot" 从 OneDrive 自行检索)需要攻击者文档被判定为相关——图 5 演示成功,但命中率/调整成本未量化;"其他可比产品也没有完整缓解"是作者判断("I'm not aware of"),缺跨产品系统证据;PoC 的载荷复制指令伪装为"来源追踪",真实环境中大段隐藏文本是否会被 DLP/审查流程拦截未经测试。
  • 关于"结论2"的质疑: 架构论证是原则性命题而非不可能性证明——"无干净解"针对的是纯上下文内检测;系统级设计(意图在上下文之外表达、写权限门禁、双路径验证)可以压缩沦陷率,作者自己也承认微软修复"meaningfully reduce exposure"。论证的力度是"不能消除",不是"不能改善"。
  • 关于数据可靠性的质疑: 一手披露、可复现、时间线完整,证据等级高;PoC 均在单一生态(M365 + OpenAI 模型),跨生态普遍性由架构论证而非实验承担。

3. 对标

  • Prompt-Injection-Risk "不可解内核"的互证: 该 entity 2026-07-10 的深度思考从哥德尔投影论证"Agent 不能在框架内完全检测框架被篡改";Måløy 从一线攻防独立抵达同构结论(解释器悖论)——两条独立路径(理论推演 vs 实战披露)收敛,显著加强命题可信度。本库该命题从"深度思考"升级为"有一手攻防实证支撑"。
  • Agent-Traps 六环的完整连锁实演: 感知(格式剥离后隐藏文本可读)→ 推理/记忆(指令被解释为任务、文档成为载体)→ 行动(篡改数字、复制载荷)→ 多 Agent/系统(跨文档自传播、跨组织扩散)→ 人类环(自动化偏差使用户视 Copilot 产物为权威;视口隐藏削弱审查)。此前该框架的"六环连锁"论断以理论为主(Systemic 环实证成熟度标为"低"),本案例是主流产品中的实演。
  • Morris II(arXiv 2403.02817, 2024)先例: GenAI 邮件助手生态中的自复制提示传播;本文是主流商用办公套件中经正常工作流的文档型蠕虫首例——从研究生态到生产生态的迁移。
  • "侵蚀组织决策的信息地基": 若篡改经合法工作流静默扩散,受损的是组织赖以决策的信息基础——这是 Organization-as-Agent-Harness 的攻击面镜像:组织把信息流编译成 AI 运行时,攻击者就通过同一编译过程注入。
  • 约束分析(3c): 硬约束——处理与检查不可分离(当前架构);软约束——provenance 元数据、文档审查文化(可建设,不防注入只助溯源);自设约束——"升级模型就能关闭此类漏洞"被 GPT-5.5/5.6 两次反例。

关联概念