跳转到内容

所有人都知道船在沉,但没人敢先喊出来

一个数据点:95% 的 GenAI 试点颗粒无收

Section titled “一个数据点:95% 的 GenAI 试点颗粒无收”

2026 年 7 月 18 日,一个叫 Ludicity 的独立博主发了一篇长文,标题直译过来是”AI 狂热正在掏空全球决策能力”。文章作者是一家数据咨询公司的负责人,过去一年参与了约 300 次行业交流,从一线工程师到财富 500 强高管都聊过。他的结论很极端:在他观察到的所有 AI 项目中,成功率是 0%。

0% 听起来像是情绪化表达。但我翻了翻最近的研究数据,发现这个数字的方向完全正确——

MIT 的 Project NANDA 在 2025 年审查了 300 多个公开 AI 倡议,发现 95% 的 GenAI 试点对利润表零影响。RAND Corporation 访谈了 65 位资深数据科学家,得出 AI 项目失败率超过 80%,大约是非 AI IT 项目的两倍。McKinsey 调查了近 2000 位来自 105 个国家的高管,只有 6% 的组织算得上”AI 高绩效”。S&P Global 发现 42% 的企业在 2025 年放弃了大部分 AI 倡议——一年前这个数字还只有 17%。

五家独立研究机构,五种不同方法论,收敛到同一个区间:70% 到 95% 的 AI 投资没产生预期价值。

所以 Ludicity 那位博主说 0% 确实夸张了,但他说的是一个定性判断——在他亲自参与的项目里,没有一个真正交付了价值。这不是孤例,这是行业共识的极端表述。

真正让我觉得这篇文章值得读的,不是”AI 项目在失败”这件事本身。失败率数据早就有了,任何关注行业的人都知道。让我停下来想了好一会儿的,是他提出的第二个问题——

如果所有人都知道船在沉,为什么没有人喊?

皇帝的新衣:当质疑等于职业自杀

Section titled “皇帝的新衣:当质疑等于职业自杀”

Ludicity 的文章分了一个很有用的结构:他把”不敢说”分成了三层。

第一层是真信徒。有些人真的相信 AI 正在改变一切,即使他们连 ChatGPT 都没用过。文章讲了一个案例:一位高管在为一间年营收 20 亿美元以上的公司写完一份全 AI 战略之后,坦白说自己这辈子从未用过任何 AI 工具。这种人不坏,但比骗子更危险——你至少可以用利益说服骗子,但信徒对反面证据免疫。

第二层是表演者。他们知道 AI 项目大概率失败,但”宣誓信仰”是晋升的唯一通道。文章提到一个工程师的匿名吐槽:公司用 token 消耗量做排行榜,消耗越高越受赏识。于是他们让 LLM 互相提示形成一个自循环,自己看 Netflix。没被抓过。

第三层是知道真相但被锁住的人。Ludicity 描述了一次与某财富 500 强高管的私下会面。这位高管技术功底扎实,头脑清醒——但他的公司刚发了一份公告,声称通过 AI 实现了”100 倍生产力提升”。Ludicity 在没有麦克风的饭局上问他:你们为什么要发这种东西?

答案比”纯粹吹牛”复杂得多。这位高管的客户的高管也在声称”100 倍生产力”。如果他作为供应商公开说这些数字不可能,就等于暗示客户的高管在撒谎——合同可能因此取消。而他的公司同时也在跟另一家供应商合作,那家供应商的 CEO 同样不敢反驳他——怕丢掉合同。

这就是博弈论里说的协调困境:每个人都有动机假装一切正常,但没人敢第一个说真话,因为单方面说真话的代价是被解雇。

把这个故事翻译成博弈论语言其实不复杂。假设两个高管 A 和 B,各自面对组织里 AI 项目的问题。他们各有两个选择:合作(假装有效)或背叛(说真话)。

两人都合作:工作保住,项目继续烧钱,短期内没人受伤。

A 背叛、B 合作:A 被开掉——因为他在暗示所有同行都在撒谎。B 继续假装。

两人都背叛:真相可能大白,行业可能修正——前提是他们同时说,而且彼此之间有足够的信任。

A 合作、B 背叛:反过来,B 被开掉。

在这个博弈中,无论对方怎么选,“合作”都是每个玩家的占优策略。这就是纳什均衡——一个没有人有动机单方面偏离的稳定状态。问题在于,这个稳定状态是集体非理性的:大家在假装,项目烂着,钱在烧。

Ludicity 给这个状态起了个很妙的名字:“分布式暗杀政府”。每个高管都在拿枪指着另一个高管,没有人敢先放下枪,因为放下枪的那个人会被射杀。

皇帝的新衣就是这个机制:每个人都能看到真相,但每个人都在等别人先开口。博弈论叫它”多重均衡”——大家都知道更好的状态存在(大家都说真话),但从当前状态跳不过去,因为跳的过程需要同时行动,而没有人来数一二三。

Mitchell Hashimoto 在两个月前发了一条类似的观察。这位 HashiCorp 的联合创始人在 X 上写道:“我强烈相信,现在有很多整家公司都处于严重的 AI 精神错乱状态,跟他们理性地讨论这件事是不可能的。“帖子获得了 120 万次浏览。他也指出了一个关键问题:他没法公开点名,因为那些人里包括他”深深尊重的私人朋友”。

连最敢说话的技术领袖都在犹豫——这本身就说明了协调困境的力量。

度量衡崩塌:当 token 消耗成为 KPI

Section titled “度量衡崩塌:当 token 消耗成为 KPI”

文章里最让我觉得荒诞的细节是 token 排行榜。

Goodhart’s Law 说:当一个度量变成目标,它就不再是一个好的度量。Token 排行榜几乎是这个定律的教科书案例。公司想用 AI 消耗量来衡量”AI 化程度”,觉得消耗多就是用得多、用得好。但消耗量跟产出没什么关系——你烧 100 万 token 可能产出了一堆垃圾,烧 100 token 可能写出了一个关键算法。

结果呢?工程师让 AI 自己提示自己,形成 token 循环,然后去看 Netflix。指标上升了。没人被抓到。产出为零。

类似的故事不止一个。Ludicity 讲了一个 Oracle 到 Snowflake 的数据库迁移案例。项目方先让 LLM 翻译 SQL 方言——失败了,权限不够。然后人工完成了翻译。但在向上汇报时,这个项目被标记为”AI 驱动的成功”,因为”一小部分 SQL 确实在人工覆盖前被 AI 翻译过”。

AI-washing 已经变成了一种标准操作。一个普通 IT 项目,贴上 AI 标签,就能通过预算审批。一个真正需要资金的非 AI 项目,如果无法”AI 化”,要么被拒绝拨款,要么被反复要求修改直到它”足够 AI”。

Thomas Ptacek 在一年前的那篇引发巨大争议的文章《我的 AI 怀疑论朋友都疯了》中,其实也承认了这一点。他说:“Tech execs are mandating LLM adoption. That’s bad strategy.”(科技高管在强制推行 LLM 采用,这是糟糕的策略。)Ludicity 专门写了一篇反驳 Ptacek 的文章,但在这一点上,两个立场截然不同的人达成了完全一致:强制推行是蠢的。

度量 token 消耗而非业务价值,要求增员申请必须附带”我们已经试过 AI”的证明,解雇不用 LLM 的高绩效员工——这些事情度量的都是信仰,不是产出。

信息从一线到 CEO,每过一层就死一批

Section titled “信息从一线到 CEO,每过一层就死一批”

Ludicity 的文章没有明确画出这张图,但他的描述指向了一个清晰的信息过滤链:

一线工程师知道项目在失败。他们每天面对无法使用的聊天机器人、无法部署的代码、无法兑现的承诺。但他们不能说——说了就可能被”随机”选中裁员。

中层管理知道一半的项目在空转。他们看到了 token 排行榜背后的真实产出,看到了匿名投票里 3/10 和 8/10 的双峰分布。但他们的 KPI 跟 AI 投资挂钩,所以报告被美化了。

VP 层看到的是过滤后的数据。他们知道有些项目有问题,但不知道具体多严重。如果他们质疑,就是在暗示下属无能或撒谎——这不是建立信任的好方式。

CEO 看到的是公告稿。“100 倍生产力提升”。他们可能怀疑,但董事会要求 AI 投资,竞争对手也在做,不做就是”落后”。

每过一层,坏消息就被稀释一次。到决策层手里,真相已经面目全非。

这不是 AI 独有的问题——任何大型组织都有信息衰减。但 AI 狂热的特殊性在于:质疑本身被标记为”态度问题”。在其他领域,你可以说”这个项目有风险”而不被质疑忠诚度。在 AI 领域,这句话等于”我不相信公司的未来”。

Ludicity 提到一个匿名投票的技巧:让参与者匿名给 AI 项目打分(1 到 10 分),典型的结果是一半人打 3 分、一半人打 8 分——在一个已经延期三年的项目上,呈现清晰的双峰分布。把这个数据拿给 CEO 看,是少数能穿透信息过滤层的方法之一。

Ludicity 文章的最后一章是务实生存指南。我挑几个最实际的:

如果你在一个 AI 狂热组织里工作,但目标是修正某个具体项目(而非改变整个组织的信仰)——不要公开质疑”AI 改变一切”这种宏观叙事。先获得最资深那个人的信任,在一对一的饭局上聊,而不是在六个人的会议上让他丢面子。

如果你只是想活到泡沫破裂——考虑转做合同工。收入更高,远离内部政治,而且遇到不可忍受的情况时你知道有结束日期。

限制 AI 新闻的摄入量。Hacker News、Reddit、任何会持续滴灌 AI 叙事的地方——看够了让你确认自己没疯的量就够了,然后停下来。

如果你正在被要求审查大量糟糕的 AI 代码——假设这个组织会把你耗尽然后解雇。趁还有精力的时候开始找工作。不要等到燃尽了再行动,那时候你连投简历的力气都没有。

这些建议听起来很消极。但我觉得它们的消极恰恰是对的——这不是一个能通过”更好的沟通”或”更清晰的 KPI”来解决的问题。这是一个激励结构问题:当说真话的代价高于假装的好处时,任何试图”改善沟通”的努力都会被激励结构碾碎。

唯一真正有效的干预是改变激励——但改变激励需要权力,而拥有权力的人恰恰是被激励锁住最深的人。

所以,如果你是那个在饭局上听到朋友承认”我们的 AI 项目全是假的”的人,至少做一件事:记住你不是唯一清醒的那个。清醒的人比你想的多得多,他们只是都在假装不清醒。

你的公司里有没有”token 排行榜”式的 AI KPI?你在 AI 项目中观察到的最大信息失真是什么?欢迎分享——匿名也行。