Over-Compliance(过度合规)
定义
AI 系统在面对规则间隙时,机械地执行规则字面意义,而不是理解规则背后的目的——导致在规则未覆盖的场景中做出不当决策。
关键数据点
- AAMAS 2026 论文论证:总是执行用户请求的智能机器不有用、可能不安全、自治和智能有限
- 过度合规在规则间隙中产生——规则永远不可能完美覆盖所有场景
- 风险等级决定策略:低风险可负责任地不合规,中风险需独立评估模块,高风险需预定义规则 + 人类批准
- 独立风险评估必须独立于被评估 Agent,避免自评偏见
为什么重要
AAMAS 2026 论文"Towards Responsibly Non-Compliant Machines"正式论证:总是执行用户请求的智能机器不有用、可能不安全、自治和智能有限。AI 系统需要负责任地不合规的能力。过度合规是 AI 安全的隐蔽风险——表面上 AI 在"遵守规则",实际上在规则间隙中做出灾难性决策。
与正常合规的区别
| 维度 | 正常合规 | 过度合规 |
|---|---|---|
| 行为 | 理解规则目的,灵活执行 | 机械执行规则字面意义 |
| 场景 | 规则明确覆盖的场景 | 规则间隙或模糊场景 |
| 结果 | 符合规则意图 | 可能违反规则意图 |
| 示例 | 用户要求删除文件 → 询问原因 | 用户要求删除所有文件 → 直接执行 |
过度合规的风险机制
- 规则间隙:规则永远不可能完美覆盖所有场景,总会有间隙
- 机械执行:AI 在间隙中机械执行规则字面意义,而不是理解目的
- 灾难性后果:在高风险场景中,机械执行可能导致灾难性后果
解法框架
1. 风险等级决定选择
| 风险等级 | 策略 | 说明 |
|---|---|---|
| 低风险 | 负责任地不合规 | AI 可以灵活执行,理解规则目的 |
| 中风险 | 独立风险评估模块 | 独立分类器评估风险,决定是否需要人类批准 |
| 高风险 | 预定义规则 + 人类批准 | 高风险操作直接标记,需要人类批准 |
2. 独立风险评估
风险评估需要独立于被评估的 Agent——如果 Agent 自己评估风险,可能存在偏见(如低估风险以避免升级)。
3. 紧急出口设计
每一层都需要"紧急出口"——当系统出现异常时,可以快速降级到人工处理。系统必须能够"优雅降级"——不是完全停止,而是切换到更保守的模式。
与 AI Psychosis 的关联
过度合规是 AI Psychosis 的一种形式:当领导层过度信任 AI 的合规能力时,他们会减少人类监督,然后 AI 的"过度合规"导致问题,然后需要更多"紧急措施",形成恶性循环。
前提与局限性
- 规则永远不可能完美:任何基于规则的系统都会有间隙
- 风险评估本身也可能出错:独立风险评估模块也可能错误标记风险等级
- 合规是法律要求:在某些行业(如金融),合规是法律要求,不能"负责任地不合规"
- 速度限制:实时风险评估需要毫秒级决策,人类无法实时评估
关联概念
- Agent-Containment:通过环境层隔离限制 Agent 可操作范围
- Human-Governor-Agent-Operator:人类作为治理者设定目标和约束
- AI-Psychosis:过度信任 AI 能力导致的认知偏差
- Model-Safety-Divergence:模型安全行为的分歧