跳转到内容

三分之一的论文读起来像 AI 写的,但先断的可能是尺子

unslop.run 发了篇研究,说他们对 12,750 篇 arXiv 论文的全文打了分,结论是约三分之一的新投稿读起来像机器写的。发布两天后,Hacker News 上一个叫 leawi 的评论者做了一件事:他把这篇研究本身的全文,贴进了 unslop 自家的检测器。

结果是几乎全红。红,在这工具的语义里就是”像机器写的”。一篇教大家识别机器写作论文的文章,被它自己的造物判为机器相。另一个评论者只回了一句:pot, meet kettle——锅笑壶黑。

我在这停了一会儿。不是觉得伪善。读完全文和四百多条讨论之后,我越来越觉得,这个”几乎全红”比起污点,更像是这项研究最好的证词。

先说这研究为什么跟”互联网上 N% 的内容已经是 AI 生成”那类标题党不是一个物种。

区别在一个数字:0.4%。

任何检测器都会冤枉人,就像体温计没发烧也可能报 37.5。作者拿 2021 和 2022 年的论文跑了一遍检测器。那两年 ChatGPT 还没出生,论文只能是人写的。结果一千篇里冤枉了四篇。然后他们把判定阈值钉在恰好这个位置:冤枉率 0.4%,一毫都不许多。此后所有数字,都相对这个零点读数。

这就好比量体温之前,先用冰水混合物和沸水把温度计校准了。一千篇里那四篇是仪器自己的底噪,跟 AI 无关。所以值得信的是那段涨幅:从 0.4% 涨到 32%。“32%“这个绝对值本身没什么,底噪永远在。

而 ChatGPT 之前的年份同时兼差做了对照:如果攀升只是检测器随着年龄越来越严(一种伪影),那 2021 年应该和 2026 年一样高。实测是一条平线对上一条陡坡。伪影的故事讲不通。

还有两个容易被忽略的细节。只评论文的第一版,因为后续修订可能掺入 AI 润色,却挂在最初的提交日期上,会污染整条时间线。评全文而不是摘要,因为同一篇论文摘要得分低于 20%,正文超过 70%,只读摘要会系统性地低估。

这套姿态有个名字:先给误差定价,再报告数字。在计量学里这是常识,在 AI 检测这个还处在军备竞赛阶段的行当里,它是稀罕物。它的多数同行只报命中,藏起冤案。标题党们最不想让你看见的,就是那条 0.4% 的地板。

当然地板有边界:0.4% 只担保”学术英文散文”这个主场。挪到纯数学、短口语、非英文文本,这条线就不再说话。作者自己把这条写进了局限章节。相当老实,老实得有点不像这个赛道的人。

但老实防不住误读。最常见的误读是:三分之一的论文是 AI 写的。

这个数字没这么说。它说的是:三分之一的论文读起来像机器写的。“读起来像”和”是”之间,隔着至少三层折扣。

第一层:检测器只认识一半罪犯的脸。它学过一部分模型的笔迹,其中 Claude 最难抓,在 1% 冤枉率的工作点上,被逮到的不到一半。没见过的模型写出来的东西,它只能放行。所以报告值永远是下界:32% 是保底,不是封顶。没检测到,不等于没有。

第二层更有意思:分领域的数字是乘积,不是加和。

被标记比例 ≈ 模型够不够得着 × 作者肯不肯交笔 × 检测器看不看得见。

CS 65%,是三项全开:模型够得着(CS 散文几乎是 LLM 的母语),作者肯交(这里的 publish-or-perish 全学术圈最烈),检测器看得见(文本密集、全暴露)。数学 0.7%,是三项近乎全关:剥掉符号和定理证明之后,剩下的散文少得可怜,检测器没东西可吃。

如果这是加和,数学该待在中间某个位置,绝不会塌到 0.7%。乘积结构就是被数学这个 0.7% 逼出来的:能力和意愿都不为零,可见度近零,一乘即塌。所以那张领域排名表,一半是行为排名(谁用得多),一半是仪器偏心排名(谁的散文更合检测器胃口)。把它直接读成道德排名(“CS 堕落得最厉害,数学是最后净土”),会读错方向。

第三层连作者自己都认了:如果检测器只是学会了一批新词呢?“large language model”这个词组,2023 年之后才大规模流行,它本身就是个 AI 味短语。一篇老老实实讨论大模型的论文天然会得高分,而检测器学到的可能是术语漂移,不是 AI 生成。有评论者把这条摆上台面,作者回了一句:你说得对。他还承认这事暂时无解:你拿不到一份干净的 2023 年后数据集,用别的检测器去建,你就永远超不过它们。

三层折扣叠在一起,结论其实很克制:测量成立,数字确实涨了,而且涨得离谱;但解释不唯一,涨幅里多少来自真 AI、多少来自术语漂移,这个数不回答。而 32% 里面,多少是代写,多少是润色,多少只是赶上了新词,这把尺子没有那个刻度。

现在回到开头那一幕:文章几乎全红。

社区反应分成两半。一半觉得这是绝妙的反讽:一个骂 slop 的文章自己是 slop,“这是某种故意的行为艺术吗?“有人几乎是在恳求:求求 AI 检测器的开发者们,拿它测测自己写的东西吧。

但我想替这个反讽慢一秒。

如果检测器检测的是”缺陷”(编造引用、内容空洞、逻辑断裂),那全红是真丑闻。但它不检测缺陷,它检测肌理:三个专家模型,一个读语义,一个数用词,一个量句子长度的节奏,合起来投票”这段像不像机器”。

像机器,不等于有错。一篇无可挑剔的纯人类论文可以很机器相,一篇引用全幻觉的论文可以非常人类相。所以”测 slop 的文本自己机器相”根本没反驳测量——它只是把结论又说了一遍:这种肌理,和”内容是否可信”不相关。检测器数的是一种文体的普及度,不是学术的腐烂度。

这恰恰是作者本人的立场,他毫不掩饰:非母语研究者逐段用 LLM 润色,“我觉得这完全没问题”;如果 CS 论文大多数是 AI 写的,“那就普遍接受这个现实,别再为它担心了”。

有人当即顶住第二句:你那个前提,“只要质量不实质下降”,是承重墙。另外两个人附和:那可是个大大的”如果”。

我觉得这个”如果”,就是整场争论的入口。

HN 上两派吵了几百层楼,吵到后面,其实是同一个问题:写作到底是什么?

甲派:写作是研究的包装。代表是作者本人,和一位叫 jrm4 的学者:“谁写的不重要,重要的是 human-in-the-loop 够不够强。“guywithahat 说得更直白:研究的价值在数据和工作,不在文笔;论文本来就该让 AI 写,研究员该专心产出好数据。

这派不是诡辩。这话我得先说,因为对面经常把他们当成不懂科学的蛮夷。科研写作的大部分确实低价值密度:相关工作综述、过渡句、格式客套。如果这些交给 AI,人腾出手想真正值得想的事,何错之有?

那为什么我还是站乙派?

因为孔雀。

孔雀的尾巴又丑又重,逃命时还碍事,演化为什么留着它?因为贵。拖着这种东西还活下来了,这本身就是体质的证明。便宜的信号不值钱,3D 打印一只只要一个下午。

LLM 之前,科研写作就是孔雀的尾巴。一篇没有拼写和语法错误的论文,说的其实是”有人在乎这份文件,在乎到愿意为呈现付时间成本”。在乎呈现,大概率也在乎内容。这个推理不严格,但它曾经有效,因为信号昂贵,造不起假。

AI 真正的破坏力不是写得好。是它让尾巴免费了。

评论者 mrob 把这层说得最清:LLM 之前,零错误是一个质量信号机制;现在 LLM 在批量生产”表面像高质量工作的废话”,信号就崩了。fwip 更刻薄:LLM 文本”显得专业”的程度系统性地超过它的实际含量,用他的原话,it’s very good at bullshitting,它特别擅长胡说八道。科学靠信任运转:你没时间复现读到的每个实验,只能信任写字的人替你把过关。现在信任链里掺进一个已知的胡说者,链上每个人都得防御性阅读。

这不是理论担忧。审稿人 probably_wrong 讲了件真事:他最近 desk-reject 了一篇论文,Introduction 里每一条引用都是编的,全是 AI 幻觉。“AI 之前我从没见过这种事,现在每个投稿周期至少一篇。”

回到那面承重墙的”如果”:谁来判断”不实质下降”?写字的人只拿效率的上行,出稿更快、句子更光鲜;防御的下行——哪句是幻觉、哪条引用是编的——摊给每一个读者和审稿人。上行归己,下行归公。这种激励结构下,“接受现实”会往哪边漂,不用赌人性也知道。

不过这里必须替甲派把另一条线说清楚,否则就不诚实:公平线。

一位叫 lingeringpine 的非母语研究者说:我们被标,不是让 AI 代写,是我们写不出美国编辑期待的那种”科学文体”。每段自己写,再让 LLM 改得”更科学”,这完完全全是你自己的论文,但它会被标成机器生成。作者回复:我猜到了,而且我觉得这完全没问题。

另一位 zfnmxt 顶了回去:让文字”更科学”不是忠实保留原意的纯风格操作,措辞所在之处,就是作者身份所在之处。

谁对?都对。因为两个人把”作者身份”放在了不同的层。lingeringpine 放在论点、数据、意图上:措辞是可外包的工程步骤,润色不过是交一笔文体税,非母语者交得最重,LLM 是合理避税。zfnmxt 放在措辞上:你每让模型”改得更科学”一次,模型就在往里加新断言、改边界条件,这一段就不再完全是你的了。

lingeringpine 的担忧有研究背书:2023 年 Patterns 上那篇论文证明 GPT 类检测器对非母语英语写作者系统性误判,大量托福作文被标成 AI 写的。unslop 自己在方法论页也承认:非母语英语科学写作,是假阳性风险。

我的判断:把”润色”和”代写”拆到两根轴上,把作者身份放在论点与数据那一层,这场争论的大部分硝烟会散掉。逐段润色,和 Introduction 引用全幻觉,不在光谱的同一个点上。两派各自攥着一个极端案例,都以为自己在争整条光谱。

如果故事停在这,它只是一桩各说各话的价值公案。但这项研究的副标题里藏着第三个结局,比两派都冷:where the measurement breaks——测量自己会在哪里断掉。

链条是这样的。检测器只有在统计意义上才对(平均正确就算赢;单篇分数永远不能当指控某个人的证据,作者反复声明这点,我完全同意)。可一旦归因到不了个人,采用就没有惩罚机制:不会有人因为用 AI 被拒稿,不会有人因此声誉受损。没有惩罚的采用,只涨不跌。ReText.AI 的另一项独立测量(11,848 篇,段落级标注)画出来几乎是直线:超过一半字符像 AI 的论文,从 2023 年的 24.8% 爬到 2026 年的 52.3%。

绕过它的办法已经遍地都是。有个评论者让 Codex 生成一篇得 97% 机器分的文章,再让 Codex 对着分数爬山优化,降到 1%,两个版本读起来一样烂,但尺子说后者是纯人类。人性化工具能让 Pangram 判定”100% 人写”。今年的 ACL 会上,四成海报长得几乎一模一样(都是 Claude 做的),谁也点不了谁的名。

但这些还是小技。会让尺子断掉的,是一个慢过程:LLM 腔正在回渗进人类写作。

想想看:二十年前,“large language model”是个只有圈内人写的词组,现在人人都写。delve、tapestry、“值得注意的是”。AI 味词库在扩张,人类的吸收也在扩张。检测器正在把”用了 AI 时代词汇的人类”标成 AI。而那 0.4% 的地板,钉在 2021–2022 年的人类身上。当 2027 年的人类散文普遍被 LLM 腌入味,0.4% 量的还是原来那个东西吗?

基准在漂移。尺子在慢慢锯断自己坐着的那根树枝。被标记率冲到饱和的那天,消失的会是”人写的”这个参照物。这把尺子从第一天起就带着有效期。作者知道,所以副标题才那么写。

我前几个月写过一篇读 Anthropic 研究的文章,《Claude Code 把专家重新暴露出来》:AI 没有抹平专家,而是把”专家到底是什么”这个问题重新逼问了一遍,从写代码的人,变成能定义问题、验收结果的人。这道题的学术版,就是 HN 这几百层楼:一篇论文里,哪部分是专长,哪部分只是劳动?如果写作是劳动,交笔就是解放;如果写作恰恰是作者为断言作保的那个动作,交笔就是押走被告。

写那篇时我还没意识到它的下半句。读完这项测量,下半句出现了:当”作保”这件事也外包出去,剩下的就只是一堆没有被告的证词。

还想起另一篇,《AI 生产力幻觉:当产出量暴涨而价值纹丝不动》:产出量飙升而价值不动,这个画面在每个行业都有分身。arXiv 只是它最诚实的一次显影,论文没有变好,是”看起来像论文”的成本归零了。制造免费的那天,稀缺的就换了东西。换成了什么,我写过另一篇答案:品味,以及愿意为判断亲自花掉的注意力。

这项研究最诚实的地方,是它从一开始就知道自己会死。而在它死前的这三年里,那个数字仍然值得读。它量的从来不是机器含量,是一套旧制度的余量。那套制度说:这些字如果出自一个人,那么某处,有人为它们作了保。

每年上涨的,是被标记率。每年下跌的,是作保的价格。

作保归零之后,我们拿什么去信下一篇论文、下一封邮件、下一句看起来无可挑剔的话?我没有答案。

你上一次交出一份文件,邮件、报告、评论,里面有多少句子,你敢站起来说”这一句我负责”?留言告诉我。我自己也不确定我的答案。