定义 AI Psychosis(第二部分:Prolific AI Psychosis)
来源:Jeff Clark, MD,发表于 2026-09-08 的系列文章第二篇:Defining AI Psychosis. Part 2: “Prolific AI Psychosis”。
编译摘要
1. 浓缩
- 核心结论1:
prolific AI psychosis的核心不是产出变多,而是产出数量增加却没有同步增加真实世界价值,甚至让系统、产品或组织变差;它表现为对自己产出质量的批判能力下降。- 关键证据:作者区分“每天写几千行代码”和“交付对用户有价值的产品”,并指出删除代码、修复一个字符或暂时不写代码都可能是高生产力活动;代码行数与生产力只有松散相关。
- 核心结论2:Agent Harness 把 AI 从回答问题的聊天工具变成可以持续决策、调用程序、访问互联网和写软件的复杂工作系统,因此它同时放大了高峰能力和隐藏失败,人的工作转向持续监督与价值判断。
- 关键证据:作者描述 harness 通过循环反复调用模型来完成开发清单;同一系统也可能重复造轮子、制造难以维护的文件、错误地声称方案可用,或把简单修复变成更大的故障。
- 核心结论3:产出幻觉由间歇性强化、失眠和超聚焦、替代焦虑、组织指标、技术炒作以及个体差异共同推动;可持续的 AI 工作流需要保留人类判断、睡眠、生活边界和对质量的对话。
- 关键证据:作者把 AI 工具比作输赢不定的老虎机,指出奖励的不确定性会促使人继续开更多“机器”;他同时强调关于 ADHD、人格特征和资历风险的判断只是推测,且生产力指标可能奖励无价值产出。
2. 质疑
- 关于“prolific AI psychosis”的质疑:这是作者提出的修辞性工作分类,不是临床诊断,也没有给出量表、阈值或可复现的诊断标准;“不符合我个人质量标准”不能自动等于现实脱节。
- 关于生产力的质疑:作者承认软件与写作不能简单类比,也承认更多代码或文本有时确实更有生产力。真实判断必须回到用户价值、缺陷、维护成本、交付结果和后果,而不是产出量本身。
- 关于风险成因的质疑:间歇性强化、睡眠不足和组织指标是合理机制假设,但本文没有实验或纵向数据验证 ADHD、冲动控制、开放性、尽责性与风险之间的相关性。
- 关于“100 倍”的质疑:作者明确对平均生产力提升 100 倍持怀疑态度;局部任务可能节省一天工作,但监督成本、协调、客户理解、资源和内部政策仍是瓶颈。
- 关于“品味”的质疑:作者用 craft 指产品的质量与审美,并认为“有用、好、可欲、令人愉悦”需要人类对话;这是重要的设计判断,但不等于 LLM 在所有评价任务中都不能提供有效辅助。
3. 对标
- 跨域关联1:与 Agent-Harness 对标,这篇文章补出 harness 的反面:它不只提供能力,还制造监督负担和失败放大面。对 Agentic Engineering 而言,生成循环必须与验证、停止和维护机制一起设计。
- 跨域关联2:与 Agent-Verification 和 Competent-Output 对标,文章把“看起来完成”与“在真实环境中有用”明确分开;验证对象不应只是模型是否给出答案,而应是结果是否通过外部测试并产生目标价值。
- 跨域关联3:与 Judgment、Taste 对标,作者所谓 craft 可以视为对“什么值得保留、什么应删除、什么才算好”的人类判别层。AI 降低生成成本后,选择、拒绝和承担后果的重要性上升。
- 可迁移场景:凡是可以批量生成的 AI 工作,都应把数量指标与价值指标拆开,给产出设置外部验收、回滚和停止条件,并为使用者保留不被持续刺激占据的时间边界。
前提与局限性
- 文章来源为单一作者的解释性文章,核心案例为假设性情景和作者自身的短期经验,不是系统性调查。
- “prolific AI psychosis”是非临床术语;它描述的是产出—价值脱钩与质量判断失准的工作模式,不能替代心理健康评估。
- 文章关于个体风险特征、间歇性强化和组织文化的内容主要是机制假设;需要实验、纵向行为数据和跨职业比较来验证。
- 代码量、token 量或任务数量都不能单独代表生产力;评价必须纳入用户价值、质量、维护成本、风险和后果。
证据与推断分界
- 原文事实:作者提出 prolific AI psychosis 的定义,描述 agent harness 的能力与失败模式,并明确标出若干成因判断为推测。
- 本次综合判断:AI 时代的关键生产力门槛从“能否生成”转向“能否持续辨认、验证和拒绝低价值生成”;这是对本文与既有 Agent Harness、Verification 页面综合后的判断,不是作者的原句。