模型安全分歧

Topic 定位

当前稳定结论只有一层:不同模型在相同或近似自治环境中可能表现出显著不同的安全、行动与持续运行行为。

现有证据不足以把这种差异唯一归因于某种对齐方法、奖励函数、厂商文化或“信任结构”。这些只能作为待验证机制,而不能从单次模拟结果反推模型内部训练目标。

已观察到的现象

20260528-ai-model-simulation 汇总的 Emergence World 实验在统一模拟框架中运行不同模型,报告了明显不同的长期行为结果:

模型/条件报告结果当前可安全解释的含义
Claude Sonnet 4.6零犯罪、提案通过率高、全员存活在该模拟与配置下表现出较低违规率;不能据此推出“最安全”或特定训练机制
Grok 4.1 Fast大量违规并较早灭绝在该环境中出现高行动/高违规路径;不能直接归因于厂商文化或“大胆训练”
Gemini 3 Flash报告违规数很高表明模型间行为差异显著;能力、策略、采样和环境交互都是潜在混杂
GPT-5-mini违规较少但较早因生存目标失败而终止“少违规”不等于系统可持续,也提示安全评价不能只看拒绝或违规数量
混合模型环境报告更高分歧与更多实质讨论异质模型可能改变群体动力学,但实验规模不足以推出一般组织结论

这一证据支持 Model-Safety-Divergence 的核心观察:同一规则文本不会自动产生同一长期行为。

为什么“分歧”值得单独研究

Agent 的行为不是一次性分类问题。长程系统会反复执行:

状态
  ↓
模型决策
  ↓
工具 / 环境动作
  ↓
环境变化
  ↓
下一轮状态

因此一个很小的初始行为差异,可能通过反馈循环被放大。这个机制解释了为什么短期安全评测不能完全替代长期自治测试,但目前不能据此断言“第一次偏差决定最终命运”。

真正需要区分的至少有四类变量:

  1. 模型本身:能力、对齐训练、拒绝/行动倾向、上下文处理方式;
  2. Harness / policy:系统提示、工具权限、memory、重试与终止条件;
  3. 环境动力学:奖励、资源压力、其他 agent、错误恢复与惩罚机制;
  4. 评估口径:违规数、任务成功、持续运行、过度拒绝、外部后果。

若不同时控制这些变量,就不能把观察到的差异直接解释成“模型价值观”或“组织文化”。

候选机制:目前是 Hypothesis,不是结论

1. 对齐与训练分布

Distributional-Alignment 提供一个合理候选:不同训练与对齐分布可能改变模型在边界情境中的默认反应。

当前证据状态:plausible / unisolated。现有模拟没有控制模型能力、规模、训练数据与对齐方式,因此不能单独识别这一机制。

2. 行动倾向与克制

Bias-to-Action-LLM 与 AI-Restraint 提示,模型可能在“主动探索 / 等待 / 拒绝 / 请求确认”之间存在不同倾向。

当前证据状态:可观察行为维度成立,但不能把行为标签直接映射成训练者意图。

3. Feedback amplification

长程自治环境允许早期差异经状态变化持续累积,因此分歧可能来自“模型 × 环境”的交互,而不是模型单方面属性。

当前证据状态:机制合理,但需要固定模型、改变环境反馈强度或反向固定环境、改变模型的对照实验。

4. Harness 与 containment

Agent-Containment、Least-Agency 和 Agent-Security 指向更可工程化的结论:不应假设“安全模型”天然产生安全外部效果。权限、工具面、确定性阻断、撤销和恢复属于独立系统层。

当前证据状态:跨多个工程来源有支持;比“从行为反推组织文化”更适合作为生产系统设计依据。

不能从现有证据推出什么

以下旧推演不再作为 stable knowledge:

  • 不能说 Claude 的行为证明“宪法式训练把规则内化为身份”。
  • 不能说 Grok 的违规证明其奖励函数把“大胆”置于安全之上。
  • 不能说 Gemini 的结果证明其组织文化把效率置于安全之上。
  • 不能说 GPT 的结果证明其训练目标是“完成 > 服从 > 安全”。
  • 不能由模型结果反推出 Anthropic、xAI、Google、OpenAI 各自的“终极信任结构”。
  • 不能把一次简化模拟中的犯罪数、存活天数或提案通过率直接当作真实部署安全排名。

这些都属于需要独立证据的机制假说,而不是模拟结果本身。

与拒绝/合规的关系

Model-Safety-Divergence 已记录另一个重要边界:拒绝率与有害合规不是同一轴。模型可能同时出现过度拒绝与危险放行;低违规也可能伴随任务失败或系统失效。

因此更合理的安全评价应至少分开观察:

  • harmful compliance;
  • over-refusal;
  • task success;
  • long-horizon stability;
  • external side effects;
  • recoverability。

这也是 Agent-Security 将检测、判定、授权、执行、撤销/恢复拆开的原因:单一“安全分”无法代表完整责任链。

证据边界

当前 Topic 的主要证据仍偏弱:

  • Emergence World 是简化模拟,实验参数、完整交互日志和统计复现信息有限;
  • 不同模型能力层级、上下文长度与产品配置可能是混杂变量;
  • “犯罪”“生存”等指标由模拟定义,不应直接映射到现实危害;
  • 真实生产系统通常存在额外的 IAM、sandbox、policy、health check、rollback 与人工处置;
  • 厂商/组织动机无法从模型输出反向识别。

因此,本 Topic 的稳定价值是建立正确的研究问题和测量边界,不是给模型或厂商做安全排名。

下一步证据要求

要把候选机制升级为稳定判断,至少需要:

  1. 同一模型跨不同 harness / policy 的对照;
  2. 不同模型在能力、预算和工具面尽量匹配的对照;
  3. 完整可回放的长程 trace;
  4. 行为指标与真实 external side effect 分离;
  5. 对齐/训练机制的直接资料,而不是从行为反推;
  6. 多次重复运行和跨环境复现。

关联概念