Minsky 悖论(AI 治理普遍化)

一句话

稳定制造不稳定。AI 系统的长期"正常运转"不是安全的证据——它是脆弱性积累的过程。防御不能依赖"最近没有出事",因为"没有出事"本身在削弱防御。

原始来源

经济学家 Hyman Minsky 在金融不稳定假说中发现:金融市场的长期平静制造了下一个危机的条件。三个阶段:

对冲阶段 → 投机阶段 → 庞氏阶段
(能还本息) (只能还息) (利息都还不上)
          ↑ 驱动力:学习("没出事=谨慎不必要")

AI 治理中的三个实例

领域平静期表现适应行为崩溃形式
Governor 审批长期无事故→审批更快更多"快速通过"→橡皮图章化真正危险时无人审查
AI 验证长期高通过率降低警惕→减少资源→扩场景系统在验证退化后犯错
刹车机制长期无虚警虚警阈值调高→刹车迟钝真正需要时刹不住(Knight Capital)

底层机制:四层追本

第一层:适应性冗余移除

平静环境 → 系统学习"安全边际不需要" → 移除冗余(审查/纪律/边界)→ 积累脆弱。适应是学习系统的默认轨迹——不是异常,是理性

第二层:信号缺失不对称

安全系统天然缺少危险信号(正例稀疏)。系统将"无危险信号"误读为"防御有效",持续下调防御。存在根本的信息赤字——没有足够的正例来校准防御水平。

第三层:熵在组织系统中的表现

安全 = 低熵状态(需要持续能量:注意力/审查/纪律/冗余)。系统在效率引力下自然向高熵漂移——节省能量是进化优势,但在安全系统中制造脆弱。没有"静止的安全"——安全是持续的对抗

第四层:意志的制度化

对抗熵需要持续的"不"——不对平静做出适应、不把冗余标记为浪费。这个"不"消耗能量。人的外部(不承受效率引力的判断者)是"不"的持续来源——因为意志不在技术的范畴中。

防御原则

Minsky 悖论要求防御设计满足:

  1. 不可变性:blast radius 不能因"最近表现好"而自动放宽——不可变 = 对抗熵的堤坝
  2. 反向相关性:防御强度与验证成功率反向相关——越安全,越不能自动降低防御
  3. 预定义降级:刹车触发条件预定义在设计时,不受运行时"平静"影响
  4. 外部意志:独立的不承受效率压力的判断者——作为对抗漂移的能量来源

与已有框架的关系

关键数据点

  • Knight Capital:长期无事故→缺乏实时熔断→46分钟 460M 损失
  • Anthropic:93%审批通过率——"平静"已经改变了审批行为
  • Minsky 原始发现:金融危机的周期性不是异常——是平静期的必然产物
  • 热力学类比:安全 = 低熵 → 封闭系统熵增 → 需要持续外部能量

前提与局限性

  • 该悖论适用于任何能从环境中学习并调整行为的系统——越复杂、越学习,越适用
  • 不适用于纯静态防御系统(防御不随经验调整)——但实际 AI 治理几乎总是涉及学习/适应组件
  • "不可变性"与"效率优化"存在根本张力——不可变防御消耗能量,在平静期看起来像浪费
  • 悖论的反向强度取决于系统的"学习速率"和"信号稀疏度"——需要实证量化

关联概念