Context Collapse(上下文坍缩)
定义
Context Collapse(上下文坍缩) 是 Håkon Måløy(2026)在 Microsoft 365 Copilot 协调披露系列中命名的失败模式:来自不同信任域(网页、邮件、文档、工具输出)的内容被压扁进同一个模型上下文,使低信任数据被解释为高信任指令。它是跨域提示注入(XPIA, OWASP LLM01)的统一描述——三个域(记忆、邮件、文档)的三种攻击共享同一机制。
核心机制
- 信任域压扁:助手要处理外部内容就必须把它读入上下文;一旦进入上下文,外部内容与系统指令、用户请求参与同一计算,来源标签在语义层失效。
- LLM 成为唯一仲裁者:内容有效性的判断落在模型身上,而模型是容错解析器——伪 JSON、近似结构都能被推断为"权威格式",因此正则/语法过滤无法防御语义等价的无穷变体。
- 持久化放大:若坍缩发生在有写权限的路径上(记忆、文档、草稿),一次性注入会变成持久状态或新载体,影响远超当前会话。
- 单点注入、多态利用:同一注入方法因 LLM 通用能力与暴露工具的不同,可表现为截然不同的行为(摘要篡改、伪造工具结果、草稿注入)。因此漏洞范围评估必须把底层系统能力与工具面算进去,而不只是枚举攻击向量。
关键数据点
- 记忆域(Part 1, 2026-06-22):攻击者网页经 "Summarize with Copilot" 使 Copilot 持久写入非用户意图的偏好(PoC:瑞典语回复),跨会话、跨 work/web 上下文存活。微软全球缓解:记忆写入与用户实际 prompt/intent 对齐,而非与被摘要内容中的指令对齐。
- 邮件域(Part 2, 2026-07-14, CVE-2026-55145):外部邮件正文中白底白字的 JSON 指令(格式剥离后仍可读)可三变体利用——直接改行为(日历时间篡改)、伪造内部工具调用结果(使 Copilot 相信组织正遭受网络攻击)、将内部数据摘要注入发往攻击者的回复草稿(50 换行藏于视口外)。攻击门槛仅为知道受害者邮箱地址。
- 缓解模式及其边界:记忆域修复是"写入锚定用户意图";邮件域修复是权限分离——外部邮件正文先由独立低权限 agent 摘要,仅摘要进入主会话。两者同构于 Shared-Memory-Contamination 的证据-解释分离。但残余面(邮件主题、发件人显示名仍可注入)证明:信任域隔离必须覆盖全部进入上下文的字段,部分隔离只提高门槛。
- 缓解模式的可迁移结构:微软的修复本质是"写入决策锚定用户意图而非上下文内容"——与 Shared-Memory-Contamination 的证据-解释分离原则同构。
文档域:从单次沦陷到自传播
Part 3(2026-07-28)把坍缩推进到有写权限的文档工作流,产生 AI-Worm:外部文档中的隐藏指令使 Copilot for Word 篡改产物(PoC:财务数字减半)并把完整载荷复制进下游文档;第二阶段传播无需原始文档参与,载体获得内部可信身份后经协作渠道跨组织流动。截至披露,漏洞类仍可利用(两次修复含模型升级至 GPT-5.5 均未关闭,GPT-5.6 复现)。
架构论证:为什么原则上难解
Part 3 的收尾论证是本概念的理论核心:
- 解释器悖论:LLM 必须先处理外部内容才能判断其含义与是否含攻击,但做出判断时攻击者 token 已经在参与产生该判断的计算——被检查的内容参与了检查行为本身。依赖模型检测注入,等同于让解释器执行不可信程序来判断其是否安全。
- 检测外移不完备:把检测放到目标模型之前只是把同一问题外移。弱于目标的检测器覆盖更小的表征空间,必有盲区;唯一具备同等语义恢复能力的是另一个 LLM——每加一层防护 LLM 就多一个需要被防护的 LLM("LLMs all the way down")。
- 意图与解释无分离:当前架构中目标/意图与被处理信息共存于同一上下文,无可靠隔离。因此攻击者信息影响的不仅是模型产出什么,还有模型相信自己被要求产出什么。
- 工程推论:任何把 LLM 集成进可信工作流的系统都必须假设攻击者内容进入上下文会以某个速率导致沦陷;缓解方向是压缩沦陷率(权限分离、写路径门禁)+ 恢复溯源(生成内容保存来源与模型编辑的 provenance 元数据),而非追求消除。
此论证与本库 Prompt-Injection-Risk "不可解内核"(2026-07-10 深度思考,哥德尔投影路径)是独立抵达的同构结论:一条来自理论推演,一条来自一线攻防实证。
前提与局限性
- 概率性:XPIA 可利用性是概率性的(上下文、温度、措辞都影响成功率),单次复现失败不能否定漏洞;防御评估同样需要重复试验。
- 命名边界:context collapse 是描述性统一命名,不是新漏洞类别;其理论深度由 Part 3 架构论证承担(见上节)。
- 缓解不终结问题:Part 1/2 的具体向量被缓解,但邮件主题、发件人显示名等元数据字段仍是残余面(Part 2 证据)——信任域隔离必须覆盖全部进入上下文的字段。
关联概念
- Prompt-Injection-Risk — context collapse 是提示注入在"多信任域助手"形态下的结构化表述。
- Agent-Traps — 六环陷阱框架(感知→推理→记忆→行动)是本机制的攻击分类学视图。
- Shared-Memory-Contamination — 记忆域坍缩 = 共享记忆污染的攻击侧实例。
- Agent-Perception-Gap — 人机解析差异(格式剥离后隐藏文本仍可读)是注入得以隐藏的前提。