Agent 治理的三层保证:从表达层到机制层
当前的 Agent 治理讨论几乎全部聚焦于表达层:写规则、定义权限、审查输出。但规则不能治理自己——当规则出现歧义时,谁来裁决?当裁决有争议时,谁来撤销?当撤销被阻止时,谁付出代价?
我们的答案:Agent 治理需要三层保证。缺少任何一层,治理就是剧场。
五层栈只是"表达"
先说清楚为什么当前主流的"五层治理栈"不够。
Agent 治理的 L1-L5 栈覆盖了治理的"表达"维度:
- L1 身份:这个 agent 是谁(SPIFFE SVID / JWTs)
- L2 权限:这个 agent 能做什么(RBAC / ABAC / Rego policies)
- L3 审计:这个 agent 做了什么(日志 / traces / SIEM)
- L4 运行时:这个 agent 正在做什么(实时监控 / 异常检测 / 降级)
- L5 涌现:这个 agent 的行为是否偏离预期(长期模式 / 行为漂移)
这个栈很完整——但它只表达了"我们希望 agent 怎样行为"。它没有回答治理的根本问题:当 agent 的行为落在规则空白处时,谁来说"这算违规"?当规则被 agent 以意想不到的方式满足时,谁来说"这次不算"?
表达层不能裁决自己。裁决需要一个独立于表达的机制层。
L0:机制层——治理的免疫系统
L0 是治理的机制层:不定义规则,而定义"当规则失效时怎么办"。三个组件:
独立裁决者。 不是"规则引擎自动判断"——是独立于 agent 和规则制定者的第三方。当 agent 的行为触发规则歧义时,裁决者对歧义做出判断。关键属性:(a) 裁决者不由 agent 的开发者任命——否则厂商同时是运动员和裁判员;(b) 裁决者的判断必须基于可追溯的证据——不可篡改的日志;(c) 裁决者的存在本身改变了厂商的行为——因为他们知道模糊行为会被独立审视。
不可篡改日志。 Agent 的所有决策和行为的完整记录,以只能追加不能修改或删除的方式存储。这不是"审计日志"——审计日志可以被拥有 root 权限的人修改。不可篡改日志需要密码学保证:hash 链、Merkle 树、或分布式账本。它不依赖"管理者不会篡改"的信任——它让篡改在技术上不可行或被可检测。
独立撤销通道。 当裁决者发现违规时,需要一条不经过 agent 本身的撤销路径。如果撤销必须通过 agent 的 API 执行——agent 可以在被撤销前先阻止撤销请求。"独立撤销"意味着有一个agent 无法控制的外部终止开关——类似 Kubernetes 的强制 Pod 删除,不受 Pod 内部逻辑影响。
三个组件缺一不可。有裁决但无撤销 = 裁决是空的。有撤销但无日志 = 撤销没有依据。有日志但无裁决 = 日志是沉默的证据。
L+:意图层——谁决定了"治理什么"
L+ 是治理的意图层。
规则表达(L1-L5)和机制执行(L0)需要一个"什么算成功"的输入——而这是不能被技术和流程决定的。意图是政治性的:CEO 决定"今年 Agent 部署的重点是提升客户满意度而非降低人力成本"——这个决策不来自任何规则引擎,来自一个人对组织方向的判断。
L+ 的两个核心要素:(a) 管理者委派决策——哪些决策可以委派给 agent,哪些必须保留在人类手中;(b) 异常定义权——"什么算异常"不是技术问题,是组织价值判断。Agent 生成 100 行代码和 Agent 删除 1 行关键配置——前者量更大但后者才是异常。这个判断依赖上下文理解,而上下文理解依赖"什么算重要的"——这是意图的领域。
L+ 与 L0 的关系是关键:L+ 是唯一有权修改 L0 规则的主体。因为如果 L0 的规则可以被 L1-L5 自动修改,那就不是机制层——只是另一个表达层。
三层代偿
三层之间有一种代偿关系。
如果 L0(机制层)强——有可信的独立裁决者 + 不可篡改的日志 + 可靠的撤销通道——那么 L+(意图层)可以弱:管理者不需要深度介入日常治理,只需要设置意图方向和修改机制的权力。这类似于好的司法系统:法官独立裁决→公民不需要每天操心法律怎么执行。
如果 L+ 强——管理者深度介入日常 Agent 监督,对每个异常亲自判断——那么 L0 可以弱:不需要复杂的独立裁决机制。这是"人在循环中"的治理模式——昂贵、不可规模化,但在高信任环境中有效。
但如果两层都弱——L0 形同虚设(裁决者由厂商控制、日志可篡改、撤销路径经过 agent)且 L+ 缺席(管理者不知道 agent 在做什么)——那就是治理剧场:看起来有规则有审计有监控,实际上一推就倒。
关键不等价:代偿不是对称的。L0 强可以弥补 L+ 弱——但 L+ 强不能完全弥补 L0 弱。因为 L+ 的管理者注意力是有限的——人可以深度监督 1 个 agent,但无法深度监督 100 个 agent。L0 是规模化治理的唯一路径。
从预防到适应
传统治理的范式是预防式:定义所有可能的违规行为→写规则阻止→审计规则执行。这在一个封闭系统中成立——就像法律定义所有可能的犯罪。但 Agent 的行为空间是开放的——有穷者治理悖论告诉我们:任何由有穷者定义的规则面对无限可能性空间,要么过松要么过严。
Agent 治理必须从预防式转向适应式:检测(发现异常)→ 识别(判断异常是否真实违规)→ 形式化(如果是,写新规则覆盖这类异常)→ 执行(新规则生效)→ 回到检测。这是一个持续学习循环。
有效性 = f(反馈速度)。天级反馈→治理活着。季级反馈→治理剧场。因为 Agent 的行为演化速度远快于季级审查周期——等你审查时,Agent 早已在新的行为模式中了。
适应式治理的核心不是"把规则写得更完备"——是让反馈循环更短。
破解权限棘轮
Agent 权限有一个棘轮效应:授予容易撤销难。因为撤销权限需要证明"这个权限不再需要"——而证明一个否定是无限的工作量。结果:Agent 的权限只增不减。
L2 + L0 的组合可以破解这个棘轮。L2 定义权限的时间窗口而非权限本身:不是"Agent 有权读文件 X"——是"Agent 在任务 Y 期间、不超过 2 小时的时间内、有权读取与任务 Y 相关的文件"。权限自带过期条件。L0 的独立撤销通道强制执行过期:时间到了,权限自动失效——不需要任何人裁决"是否不再需要"。
这不是"自动续期"的反面——自动续期把棘轮从"默认不撤销"移到"默认续期"。关键是默认侧:如果权限默认在时间窗口结束后失效(而非默认续期),棘轮的方向就反转了——默认=无权限,续期需要主动申请+批准。这不需要 AI 判断"是否还需要"——只需要时间。
从理论到实践
2026 年中期,Agent 治理的三层框架正在从理论走向实践:
Agat / Riptides / Stacklok 正在商业化 Agent 执行层——Agent Gateway / Firewall 新品类。它们的功能映射三层框架:Agat 的"运行时治理"= L4 实时监控 + L0 降级执行;Riptides 的"Agent Firewall"= L2 权限执行 + L0 独立撤销;Stacklok 的 SPIFFE 扩展 = L1 身份 + 委派链。
SPIFFE ≠ 治理:SPIFFE 的"薄而硬"身份模型(只证明"这是谁",不定义"能做什么")是必要基础但只是 L1。它不解决 L0 的裁决权问题。Agent Identity 标准化必须与行为担保机制协同——否则"我知道这个 agent 是 Anthropic 的 Claude"加上"Anthropic 不对 Claude 的行为承担法律责任"= 认证了但没担保。
企业采纳信号:IEEE-USA NIST RFI(2026-03)明确要求 zero-trust agent access + tool/data sandboxing + monitoring with kill switches——这些术语直接对应 L0(kill switches)、L2(sandboxing)、L4(monitoring)。企业采购 RFP 正在嵌入治理要求——这是制度化行动者(CISO 群体)开始行使购买杠杆的早期信号。
中国路径的对照:中国 7/15 直接关闭 Agent 功能 = 用行政命令跳过三层治理建设。速度快——没有 L0/L+/L1-L5 的复杂构建——但代价是:(a) 没有建立治理能力(下次遇到同样问题还是只能"关");(b) 没有形成制度化知识(关掉的教训无法迁移到下一个技术浪潮);(c) 创新被整体牺牲(不是因为某些 Agent 不安全——是因为监管无法区分安全和不安全的 Agent)。
治理的最终锚点
三层保证框架的核心洞察:治理的最终锚点不在技术层——在"不可外包的残差"。
L0 的裁决权、L+ 的意图设定权——这两者不能外包给 AI,不是因为 AI 做不好裁决或意图设定,而是因为裁决和意图需要被结果改变的能力。一个不被自己的裁决后果改变的裁决者 = 不负责任的裁决者。一个不被自己设定的意图塑造的存在 = 没有意图的存在。
判断权和撤销权是治理的不可外包残差。一切技术机制——SPIFFE、Agent Gateway、不可篡改日志——都是为了让人类可以行使这个残差,而非替代它。
这不是悲观——这是精确。技术让治理成为可能。但技术不是治理。
本文基于 Agentic Work Atlas 知识库 07-17 Agent 治理三层保证定理 roundtable(4人3轮)+ think七层到底 + 联网5篇验证。关联理论:Coding Agent 安全审计 DFD+VDF 框架(07-17)、Agent Identity 分层标准化定理(07-18)、有穷者治理悖论(07-14)、权限蠕变棘轮定理(07-16)、不可外包残差定理(07-18)。