Frontier Developer Obligations
定义
Anthropic (2026) Advanced AI Framework 中提出的前沿 AI 开发者义务体系:对训练计算量超过 10²⁵ FLOP、AI 相关收入超过
$5亿或 AI R&D 支出超过$10亿的开发者,要求执行测试、透明度报告、独立评估、安全保障和执法问责。
关键数据点
适用范围
- 模型阈值: 训练 FLOP > 10²⁵
- 公司阈值: AI 相关年收入 >
$5亿 或 AI 年 R&D 支出 >$10亿 - 四类风险: 生物武器、进攻性网络操作、AI 失控、自动化研发
透明度要求
- 开发并发布安全框架
- 年度合规认证
- 每六个月发布风险报告
- 部署能力显著更强的模型时发布系统卡
- 关键安全事件 15 天内报告
独立评估
- 法规颁布后六个月内,至少聘请一名合格独立评估员
- 评估员发布风险报告审查
- 政府最终可承担评估功能
安全要求
- 覆盖整个开发环境的安全程序
- 监控蒸馏攻击
- 定期渗透测试
- 特权访问方必须维护安全保护
执法与监管权力
- 禁止故意虚假或重大误导性声明
- 民事处罚随违规递增,与全球年收入挂钩
- 举报人保护
- 政府机构可阻止或威慑不安全模型的部署
防止权力滥用
- 法院执行(机构必须提起诉讼)
- 限定裁量权(仅基于特定违规)
- 一致处理和司法审查
- 不得基于无关因素优待或歧视开发者
前提与局限性
- 前提:
- 计算量阈值能合理区分危险模型
- 独立评估生态系统可以成熟
- 政府机构能有效执行而不政治化
- 局限性:
- FLOP 阈值可能随训练效率提升而过时,需转为基于能力的阈值
- 评估员购物风险(公司选择最宽松的评估员)
- 联邦优先权可能削弱州级监管
- 国际协调面临主权冲突
关联概念
- AI-Policy-Framework — 政策框架的整体论述
- Societal-Resilience — 社会韧性是框架的第二支柱
- Collingridge-Dilemma — 强制透明度来缓解信息不对称
- Anthropic — 框架提出者
- AISI — 可能承担评估功能的机构