Over-Compliance(过度合规)

定义

AI 系统在面对规则间隙时,机械地执行规则字面意义,而不是理解规则背后的目的——导致在规则未覆盖的场景中做出不当决策。

关键数据点

  • AAMAS 2026 论文论证:总是执行用户请求的智能机器不有用、可能不安全、自治和智能有限
  • 过度合规在规则间隙中产生——规则永远不可能完美覆盖所有场景
  • 风险等级决定策略:低风险可负责任地不合规,中风险需独立评估模块,高风险需预定义规则 + 人类批准
  • 独立风险评估必须独立于被评估 Agent,避免自评偏见

为什么重要

AAMAS 2026 论文"Towards Responsibly Non-Compliant Machines"正式论证:总是执行用户请求的智能机器不有用、可能不安全、自治和智能有限。AI 系统需要负责任地不合规的能力。过度合规是 AI 安全的隐蔽风险——表面上 AI 在"遵守规则",实际上在规则间隙中做出灾难性决策。

与正常合规的区别

维度正常合规过度合规
行为理解规则目的,灵活执行机械执行规则字面意义
场景规则明确覆盖的场景规则间隙或模糊场景
结果符合规则意图可能违反规则意图
示例用户要求删除文件 → 询问原因用户要求删除所有文件 → 直接执行

过度合规的风险机制

  1. 规则间隙:规则永远不可能完美覆盖所有场景,总会有间隙
  2. 机械执行:AI 在间隙中机械执行规则字面意义,而不是理解目的
  3. 灾难性后果:在高风险场景中,机械执行可能导致灾难性后果

解法框架

1. 风险等级决定选择

风险等级策略说明
低风险负责任地不合规AI 可以灵活执行,理解规则目的
中风险独立风险评估模块独立分类器评估风险,决定是否需要人类批准
高风险预定义规则 + 人类批准高风险操作直接标记,需要人类批准

2. 独立风险评估

风险评估需要独立于被评估的 Agent——如果 Agent 自己评估风险,可能存在偏见(如低估风险以避免升级)。

3. 紧急出口设计

每一层都需要"紧急出口"——当系统出现异常时,可以快速降级到人工处理。系统必须能够"优雅降级"——不是完全停止,而是切换到更保守的模式。

与 AI Psychosis 的关联

过度合规是 AI Psychosis 的一种形式:当领导层过度信任 AI 的合规能力时,他们会减少人类监督,然后 AI 的"过度合规"导致问题,然后需要更多"紧急措施",形成恶性循环。

前提与局限性

  • 规则永远不可能完美:任何基于规则的系统都会有间隙
  • 风险评估本身也可能出错:独立风险评估模块也可能错误标记风险等级
  • 合规是法律要求:在某些行业(如金融),合规是法律要求,不能"负责任地不合规"
  • 速度限制:实时风险评估需要毫秒级决策,人类无法实时评估

关联概念