AI 能力鸿沟与 AI Psychosis

编译摘要

1. 浓缩

  • 核心结论1: AI 能力认知鸿沟来自两层错位:使用的是旧模型还是最新模型,以及使用场景是否落在模型能力跃迁最陡的技术域。
    • 关键证据: Karpathy 指出,很多人以免费版或旧版 ChatGPT 的幻觉、语音模式翻车、日常问答体验来判断 AI 能力;另一群人则在 OpenAI Codex、Claude Code 等付费 agentic 模型中,把终端交给模型完成代码重构、漏洞利用或研究任务。
    • 这两群人的经验都可能是真的。免费或孤立的日常助手会犯低级错,同时高阶 coding agent 可以连续运行一小时并完成原本需要数天或数周的工程任务。
  • 核心结论2: AI 进步不是均匀铺开,而是在具备可验证奖励和高商业价值的领域先出现陡峭跃迁。
    • 关键证据: 编程、数学和研究任务更容易给出显式 reward,例如测试是否通过、漏洞是否复现、证明是否成立;写作、建议、搜索和日常聊天更难用明确指标训练和评估。
    • Karpathy 进一步指出,B2B 技术场景价值更高,模型公司自然把优化资源投入这些金矿。这解释了为什么普通聊天体验可能没有震撼变化,而 coding/agent 体验像换了物种。
  • 核心结论3: "AI Psychosis" 在这里不是临床意义,而是指长期暴露在最强 agentic coding 体验中的用户,会给 AI 能力、斜率和安全影响赋予更大重量。
    • 关键证据: 原帖名句是,一个人对 AI 的惊叹程度与其用 AI 编程的程度高度相关。池建强补充的人群分层也支持这一点:完全不用 AI、免费助手用户、付费专业用户、顶尖 AI researcher 看到的是四种不同现实。
    • OpenClaw 相关讨论说明,一批非技术背景用户第一次接触 agentic 模型后才体验到这种落差,因为他们过去对 AI 的理解停留在"ChatGPT 网站"。

2. 质疑

  • 关于使用数据的质疑: 文中引用的编程查询占比约 4%、非工作查询占比超过 73% 需要明确口径。按消息数、token 数、付费收入、模型成本或业务价值衡量,结论可能不同。
  • 关于选择偏差的质疑: Karpathy 和其时间线天然聚集技术用户,所以"震撼程度与 AI 编程量相关"可能部分反映样本偏差。法律、设计、科研和医疗等领域也可能存在类似高强度体验,只是没有被这条线索充分纳入。
  • 关于能力跃迁的质疑: "日常场景停滞"不等于没有进步,也可能是用户任务难以验证、评价主观、界面没有把能力释放出来。不能把可验证领域进步快误读为其他领域没有价值。
  • 关于社会后果的质疑: 认知鸿沟会影响组织决策。没有见过最新 agentic 能力的人可能低估冲击,深度使用者也可能高估外推速度。两边都需要把自己的观察限定在具体模型、价格层、任务类型和验证条件内。

3. 对标

  • 与技术采纳曲线对标: 早期采用者和大众用户看到不同产品形态,是颠覆性技术常态。这里的特殊性是能力差异不只来自 adoption 时间,也来自付费层级、任务可验证性和 agent 工具链。
  • Jevons-Paradox-for-Knowledge-Work 对标: coding agent 越强,专业用户越容易启动更多以前不值得做的工程任务,导致对 AI 重要性的感知进一步上升。
  • Agentic-Engineering 对标: 这篇 source 是 Agentic Engineering 的认知前提。要理解为什么有人认为工程流程会被重写,必须先理解他们看到的是能读代码、改代码、跑测试、查漏洞的 agent,而不是普通聊天机器人。
  • 可迁移场景: 任何评估 AI 能力的讨论都应先问四个问题:使用的是哪一代模型、付费层级是什么、任务是否有可验证反馈、用户是否把 AI 接入真实工作流。

关联概念