How agents are transforming work
OpenAI 经济研究论文,基于 Codex 内部使用数据分析智能体如何改变工作模式。
编译摘要
1. 浓缩
-
核心结论 1:智能体改变知识工作的基本单元——从单次对话到委托式长周期任务
- 关键证据:2026 年 5 月,80.6% 的抽样用户至少做过一次估计超过 30 分钟人类工作的 Codex 请求,70.2% 超过 1 小时,25.6% 超过 8 小时
- 关键证据:OpenAI 内部 99 分位用户每天产生 60+ 小时 agent turns(跨多个并行 agent)
- 关键证据:近四分之一 Codex 请求对应超过 1 小时人类工作量的任务
-
核心结论 2:智能体采纳遵循"开发者先行→非开发者增速反超"的 S 曲线
- 关键证据:自 2025 年 8 月以来,非开发者用户增长:个体用户 137 倍、组织用户 189 倍、OpenAI 内部 12 倍
- 关键证据:Codex 已占 OpenAI 内部每周输出 token 的 99.8%,每个部门(包括法务、招聘)都以 Codex 为主要 AI 工具
- 关键证据:非技术部门(法务、财务、招聘)在 2026 年 4 月左右跨越到 Codex 为主要工具,切换速度快于工程部门
-
核心结论 3:智能体扩展了工作边界——降低跨任务边界的成本
- 关键证据:业务职能部门超过四分之一的 Codex 工作是工程/编程类任务
- 关键证据:非技术用户经常使用 Codex 进行自动化、数据转换、工具开发、调试和结构化分析
- 关键证据:各工种(Research 56x、Customer Support 32x、Engineering 27x、Legal 13x)的使用量相对 2025 年 11 月均有大幅增长
2. 质疑
-
关于"采纳曲线"的选择偏差:全部数据来自 OpenAI 自身生态系统——一家 AI 公司的员工已经是前沿用户,结论可能不适用于传统行业。OpenAI 的"非开发者"(法务、招聘)可能比普通公司的非开发者更具技术素养。
-
关于任务视野测量的可靠性:任务视野由 LLM-as-judge 基于 Codex 转录估计,论文明确标注为"方向性而非精确"。样本仅 0.1% 用户,置信区间未知。
-
关于增长倍数的基数效应:137x、189x 的增长倍数从 2025 年 8 月的接近零基数起步,绝对数值可能不如倍数看起来惊人。论文未报告绝对用户数。
-
关于利益冲突:该论文由 OpenAI 发布以推广 Codex,数据选择和框架可能存在自我服务偏差。论文强调"前沿用户在前沿使用前沿工具"——三重选择偏差。
-
关于跨职能工作的因果方向:非开发者做编码工作可能是 Codex 降低了门槛,也可能是这些非开发者本来就有编码能力。论文未区分这两种情况。
3. 对标
-
类似 PC 革命中的技能民主化:从打字员→人人打字、主机操作员→个人计算的范式迁移。智能体正在将"编程/技术执行"从专业角色扩散到所有知识工作者。
-
类似电子表格革命的边界模糊:1980 年代 VisiCalc/Lotus 1-2-3 让财务人员开始做"编程"(公式、宏),模糊了财务与技术工种的边界。Codex 正在同方向上走得更远。
-
类似互联网采纳曲线的逆序:早期互联网也是技术人员先用,但智能体的非开发者增速远超开发者——这可能是因为 agentic 工具的抽象层级更高(自然语言交互),降低了采纳门槛。
-
知识工作"杰文斯悖论":(14) Jevons Paradox for Knowledge Work——当 agentic work 成本趋近于零,对知识工作的"消费"不降反增。OpenAI 内部使用量 27-56 倍的增长是这一悖论的组织级证据。
关联概念
- Task-Horizon — 本文提供了用户侧任务视野分布的新数据(30min/1hr/4hr/8hr 阈值)
- Agent-Adoption-Curve — 本文是该概念的一手实证来源
- Agentic-Engineering — 智能体正在改变"工程"的定义和边界
- AI-Labor-Bottleneck-Shift — 当 agent 能完成 8 小时任务时,瓶颈从执行迁到决策
- (14) Jevons Paradox for Knowledge Work — 使用量暴增的组织级证据