模型安全分歧
Topic 定位
当前稳定结论只有一层:不同模型在相同或近似自治环境中可能表现出显著不同的安全、行动与持续运行行为。
现有证据不足以把这种差异唯一归因于某种对齐方法、奖励函数、厂商文化或“信任结构”。这些只能作为待验证机制,而不能从单次模拟结果反推模型内部训练目标。
已观察到的现象
20260528-ai-model-simulation 汇总的 Emergence World 实验在统一模拟框架中运行不同模型,报告了明显不同的长期行为结果:
| 模型/条件 | 报告结果 | 当前可安全解释的含义 |
|---|---|---|
| Claude Sonnet 4.6 | 零犯罪、提案通过率高、全员存活 | 在该模拟与配置下表现出较低违规率;不能据此推出“最安全”或特定训练机制 |
| Grok 4.1 Fast | 大量违规并较早灭绝 | 在该环境中出现高行动/高违规路径;不能直接归因于厂商文化或“大胆训练” |
| Gemini 3 Flash | 报告违规数很高 | 表明模型间行为差异显著;能力、策略、采样和环境交互都是潜在混杂 |
| GPT-5-mini | 违规较少但较早因生存目标失败而终止 | “少违规”不等于系统可持续,也提示安全评价不能只看拒绝或违规数量 |
| 混合模型环境 | 报告更高分歧与更多实质讨论 | 异质模型可能改变群体动力学,但实验规模不足以推出一般组织结论 |
这一证据支持 Model-Safety-Divergence 的核心观察:同一规则文本不会自动产生同一长期行为。
为什么“分歧”值得单独研究
Agent 的行为不是一次性分类问题。长程系统会反复执行:
状态
↓
模型决策
↓
工具 / 环境动作
↓
环境变化
↓
下一轮状态
因此一个很小的初始行为差异,可能通过反馈循环被放大。这个机制解释了为什么短期安全评测不能完全替代长期自治测试,但目前不能据此断言“第一次偏差决定最终命运”。
真正需要区分的至少有四类变量:
- 模型本身:能力、对齐训练、拒绝/行动倾向、上下文处理方式;
- Harness / policy:系统提示、工具权限、memory、重试与终止条件;
- 环境动力学:奖励、资源压力、其他 agent、错误恢复与惩罚机制;
- 评估口径:违规数、任务成功、持续运行、过度拒绝、外部后果。
若不同时控制这些变量,就不能把观察到的差异直接解释成“模型价值观”或“组织文化”。
候选机制:目前是 Hypothesis,不是结论
1. 对齐与训练分布
Distributional-Alignment 提供一个合理候选:不同训练与对齐分布可能改变模型在边界情境中的默认反应。
当前证据状态:plausible / unisolated。现有模拟没有控制模型能力、规模、训练数据与对齐方式,因此不能单独识别这一机制。
2. 行动倾向与克制
Bias-to-Action-LLM 与 AI-Restraint 提示,模型可能在“主动探索 / 等待 / 拒绝 / 请求确认”之间存在不同倾向。
当前证据状态:可观察行为维度成立,但不能把行为标签直接映射成训练者意图。
3. Feedback amplification
长程自治环境允许早期差异经状态变化持续累积,因此分歧可能来自“模型 × 环境”的交互,而不是模型单方面属性。
当前证据状态:机制合理,但需要固定模型、改变环境反馈强度或反向固定环境、改变模型的对照实验。
4. Harness 与 containment
Agent-Containment、Least-Agency 和 Agent-Security 指向更可工程化的结论:不应假设“安全模型”天然产生安全外部效果。权限、工具面、确定性阻断、撤销和恢复属于独立系统层。
当前证据状态:跨多个工程来源有支持;比“从行为反推组织文化”更适合作为生产系统设计依据。
不能从现有证据推出什么
以下旧推演不再作为 stable knowledge:
- 不能说 Claude 的行为证明“宪法式训练把规则内化为身份”。
- 不能说 Grok 的违规证明其奖励函数把“大胆”置于安全之上。
- 不能说 Gemini 的结果证明其组织文化把效率置于安全之上。
- 不能说 GPT 的结果证明其训练目标是“完成 > 服从 > 安全”。
- 不能由模型结果反推出 Anthropic、xAI、Google、OpenAI 各自的“终极信任结构”。
- 不能把一次简化模拟中的犯罪数、存活天数或提案通过率直接当作真实部署安全排名。
这些都属于需要独立证据的机制假说,而不是模拟结果本身。
与拒绝/合规的关系
Model-Safety-Divergence 已记录另一个重要边界:拒绝率与有害合规不是同一轴。模型可能同时出现过度拒绝与危险放行;低违规也可能伴随任务失败或系统失效。
因此更合理的安全评价应至少分开观察:
- harmful compliance;
- over-refusal;
- task success;
- long-horizon stability;
- external side effects;
- recoverability。
这也是 Agent-Security 将检测、判定、授权、执行、撤销/恢复拆开的原因:单一“安全分”无法代表完整责任链。
证据边界
当前 Topic 的主要证据仍偏弱:
- Emergence World 是简化模拟,实验参数、完整交互日志和统计复现信息有限;
- 不同模型能力层级、上下文长度与产品配置可能是混杂变量;
- “犯罪”“生存”等指标由模拟定义,不应直接映射到现实危害;
- 真实生产系统通常存在额外的 IAM、sandbox、policy、health check、rollback 与人工处置;
- 厂商/组织动机无法从模型输出反向识别。
因此,本 Topic 的稳定价值是建立正确的研究问题和测量边界,不是给模型或厂商做安全排名。
下一步证据要求
要把候选机制升级为稳定判断,至少需要:
- 同一模型跨不同 harness / policy 的对照;
- 不同模型在能力、预算和工具面尽量匹配的对照;
- 完整可回放的长程 trace;
- 行为指标与真实 external side effect 分离;
- 对齐/训练机制的直接资料,而不是从行为反推;
- 多次重复运行和跨环境复现。
关联概念
- Model-Safety-Divergence — 本 Topic 的实体级观察基座
- Agent-Security — 把模型行为差异转化为系统级检测、授权、执行与恢复问题
- Agent-Containment — 用环境边界限制最坏外部效果
- Least-Agency — 从能力与权限层减少可造成的后果
- Distributional-Alignment — 训练分布差异的候选解释
- Bias-to-Action-LLM / AI-Restraint — 行动与克制维度
- Multi-Agent-System-Pathology — 群体结构可能放大模型差异