跳转到内容

小模型不是省钱版大模型

我读 Dharma AI 这篇《Specialization Beats Scale》,一开始以为它又会落到那句熟悉的口号上:小模型更便宜,所以企业应该用小模型。

读完发现,不是。

这篇文章真正有意思的地方,不是说 3B 小模型省钱,也不是说 frontier model 被打脸。它说的是另一件更扎实的事:当一个模型的训练历史足够贴近部署任务时,参数规模就不再是那个最能解释结果的变量。换句话说,真正击败规模的不是“小”,而是“对齐到任务”。

这点对企业 AI 特别刺耳。因为过去两三年,很多公司的默认采购逻辑其实很简单:不确定用哪个模型,就用最大的;不确定哪个效果最好,就用最贵的;不确定评估怎么做,就拿公开榜单当安全感。这个逻辑并不愚蠢。GPT-4 之后,通用大模型在太多任务上确实给了人一种很强的默认信任:它未必最便宜,但大概率不至于太差。

问题是,“不至于太差”不是生产系统的终点。很多企业任务并不需要一个懂全世界的模型,它需要一个只把一件事做得稳定、便宜、可解释、可复现的模型。

这篇文章的价值就在这里:它没有泛泛地说“小模型也很好”,而是拿 DharmaOCR 这个结构化 OCR 任务做了一个具体切口。3B 的 DharmaOCR Lite 在巴西葡语 OCR、手写文本、法律和行政文档上拿到 0.911 的综合分数,超过 Claude Opus 4.6 的 0.833、Gemini 3.1 Pro 的 0.820、GPT-5.4 的 0.750,也超过 Google Document AI、Amazon Textract、Mistral OCR 等专门或通用方案。成本上,它每百万页大约比 Claude Opus 4.6 低 52 倍。稳定性上,text degeneration rate 只有 0.20%。

如果只有成本低,我不会太在意。便宜但差一点的东西到处都是。如果只有某个指标高,我也会怀疑是不是 benchmark 设计刚好有利于它。但质量、成本、稳定性三个维度同时指向同一个 3B 专用模型,这就不是一句“小模型性价比高”能解释的了。

它更像是在提醒我们:企业 AI 的核心问题,可能不是“模型能力够不够大”,而是“任务能不能被说清楚”。

被低估的不是小模型,而是任务边界

Section titled “被低估的不是小模型,而是任务边界”

很多人讨论模型时,习惯把模型想象成一个通用员工。越大的模型,知识越多,推理越强,沟通越自然,于是看起来越像一个可以被扔进任何业务里的“高级人才”。这当然有用,尤其是在任务还没定型、需求还在探索、上下文很杂的时候。

但生产系统里的很多工作不是这样。它们更像流水线上的关键工位:识别发票、抽取合同条款、归类客服工单、审核报销凭证、把病历字段结构化、从扫描件里抽出法律文书信息。这里的难点不一定是“模型知道多少”,而是“模型能不能持续用同一套标准做同一件事”。

DharmaOCR 让我重新看了一眼这个问题。OCR 表面上是“读字”,但企业里的 OCR 从来不只是读字。它要处理版面、手写、页眉页脚、边注、法律文件的格式、行政文档的结构,还要避免模型读着读着开始自我循环,输出一堆重复文本。也就是说,失败不是一个抽象的“回答不好”,而是具体到字段错、结构乱、成本爆、延迟升、吞吐掉。

当失败能被具体定义,专用化就有了抓手。SFT 可以让模型学会严格的 JSON schema,DPO 可以把退化输出当成 rejected examples 去惩罚。这里的关键不是用了某个神秘训练技巧,而是团队知道什么叫“坏输出”,也能把坏输出变成训练信号。

这才是我觉得文章最该被企业读者认真对待的地方。专用小模型不是“预算不够时的替代品”。它是组织把任务边界、数据分布、失败样本和评估指标沉淀下来之后,得到的工程回报。

原文里有一个很重要的比较:同样是 3B,同样走类似训练流程,已经是通用 OCR 专家的 Nanonets-OCR2-3B,经过目标域训练后达到 0.921、degeneration rate 0.20%;而通用的 Qwen2.5-VL-3B 达到 0.793、degeneration rate 1.41%。参数规模相同,后续训练相似,结果差距很大。解释变量就不太可能是“大小”,而是模型一开始离任务有多近。

这句话听起来像论文里的术语:distributional alignment。翻成业务语言,其实很直白:你找的人以前干过类似的活,他再学你公司的流程,就比一个聪明但完全没干过这类活的人快得多。

这也解释了为什么“随便拿一个小模型微调一下”不等于专用化。专用化不是把小模型喂几百条数据就结束。它有层级:通用模型是一层,通用领域专家是一层,目标业务专家又是一层。每一层都在缩短模型和真实任务之间的距离。

企业采购最容易买到“能力幻觉”

Section titled “企业采购最容易买到“能力幻觉””

这篇文章让我想到企业采购里一个很常见的心理:买大模型,像买保险。

如果你选了最强的商业 API,出了问题,责任看起来比较好解释。因为大家都承认它强,出了错可以说任务太难、数据太差、prompt 还要优化。如果你选了一个 3B 专用模型,出了问题就很容易被问:为什么不用最强的?为什么为了省钱冒险?

所以大模型经常不只是技术选择,它还是组织里的避险选择。它给决策者一种“我没有选错方向”的安全感。

但这份安全感有代价。第一,成本会在规模化时变成真实问题。一次 demo 的 API 费用不疼,几百万页文档、几千万次调用、持续运行的后台流程就会疼。第二,通用模型的能力广度不等于任务内可靠性。它能写诗、写代码、解释历史,不代表它在你的发票版式、合同条款、葡语手写材料上最稳定。第三,公开 benchmark 不等于你的生产分布。模型在榜单上领先,不代表它在你的业务错误类型上领先。

我读这篇文章时最强的感受,是它把“采购模型”这个动作变成了“采购评估能力”的问题。企业真正该问的不是“哪个模型最强”,而是:

我的任务分布是什么?
我的失败样本在哪里?
我的质量指标是不是贴近生产后果?
我的成本是按 token 算,还是按完整业务单元算?
我有没有能力持续把错误反馈回训练和评估?

这些问题答不出来,直接买最大的模型也许是合理的。因为你其实还没有资格维护专用模型。可一旦这些问题能答出来,继续默认买最大的模型,就可能是在用预算掩盖组织懒惰。

我不想把这篇文章读成“小模型万岁”。那样反而辜负了它的谨慎。

DharmaOCR 的证据是在 OCR 场景里成立的,而且是一个被定义得很清楚的结构化 OCR 场景。它不能自动外推到开放式写作、复杂研究、跨领域推理、战略分析、长上下文综合这些任务。很多时候,大模型仍然是更好的入口,因为任务本身还没被定义清楚,或者需要跨多个知识域临时组合。

这也是我对一些“小模型替代大模型”叙事保持警惕的原因。很多公司并不是缺一个小模型,而是缺数据治理、标注流程、评估集、线上反馈和模型运维。没有这些东西,小模型不会自动变聪明。它只会更便宜地犯错。

Pecher 等人在文本分类上的研究也给了一个很好的边界:专用小模型平均约 100 个标注样本就可能达到或超过通用大模型,但一旦考虑方差,所需标签会增加 100%-200%;不同任务差异也很大。也就是说,专用化确实可能很省,但它不是免费的。你省下的是推理成本,花出去的是组织建设成本。

这笔账很多企业没有认真算过。它们会把 API 账单看得很清楚,却把内部数据、评估、标注、反馈、部署维护当成隐形成本。于是很容易出现两种极端:要么永远用最贵的大模型,觉得训练维护太麻烦;要么迷信“小模型便宜”,低估了把它训练到可生产状态的工程工作。

更好的判断应该是:专用化适合那些任务边界清楚、失败可度量、数据能持续积累、调用量足够大、对延迟/成本/隐私有真实要求的场景。反过来,如果任务仍然混沌、需求经常变、错误类型还没收集、调用量也不大,那就先别急着训练一堆小模型。

大模型是默认安全感,小模型是组织能力的放大器

Section titled “大模型是默认安全感,小模型是组织能力的放大器”

这篇文章对我最大的启发,是把模型选择从“能力排序”拉回“系统设计”。

大模型像一个强大的通用接口。它让企业在没有太多准备时也能开始试验,这是它的巨大价值。很多场景里,大模型依然应该是第一站:用来探索任务、生成候选方案、帮助定义字段、辅助构建评估集、发现失败类型。没有大模型,很多团队甚至不知道自己到底想自动化什么。

但一旦任务进入稳定运行阶段,大模型就不一定还应该是唯一答案。此时真正有价值的,可能是一组围绕业务流程逐步专用化的小模型:一个负责 OCR,一个负责字段抽取,一个负责分类,一个负责异常检测,一个负责把低置信度样本交给大模型或人工复核。大模型不消失,它退到更适合的位置:处理开放问题、兜底复杂样本、帮助持续改进专用模型。

这会带来一种不同的 AI 架构观。不是所有任务都挤进一个超级模型,而是把工作拆成可测量的子任务,让不同层级的模型各司其职。通用模型负责广度,专用模型负责稳定性和成本,评估系统负责告诉你什么时候该信谁。

如果这么看,DharmaOCR 的意义就不只是 OCR。它提供了一个小小的样板:当任务、数据、评价和训练闭环足够具体时,规模优势会被重新定价。不是因为规模不重要,而是因为规模解决的是通用性问题,专用化解决的是贴近性问题。企业生产里,很多时候贴近比通用更贵,也更稀缺。

我读完后的判断是:未来企业 AI 的成熟度,可能不体现在它买了哪个最强模型,而体现在它能不能把自己的业务拆成一组可评估、可反馈、可专用化的任务。能做到这点,小模型才会变成优势。做不到这点,小模型只是更便宜的幻觉,大模型则是更昂贵的幻觉。

所以这篇文章最该留下的不是“小模型击败大模型”的标题,而是一个更难的问题:你的组织有没有能力让模型变得专用?

如果一个 3B 模型能在清晰任务里赢过 frontier API,你觉得企业下一笔 AI 投资应该先花在模型调用上,还是花在任务评估和数据闭环上?

Dharma AI, “Specialization Beats Scale: A Strategic Variable Most AI Procurement Decisions Overlook” https://huggingface.co/blog/Dharma-AI/specialization-beats-scale

Gabriel Pimenta de Freitas Cardoso et al., “DharmaOCR: Specialized Small Language Models for Structured OCR that outperform Open-Source and Commercial Baselines” https://arxiv.org/abs/2604.14314

Dharma-AI/Dharma-OCR-LITE model card https://huggingface.co/Dharma-AI/Dharma-OCR-LITE

Branislav Pecher, Ivan Srba, Maria Bielikova, “Comparing Specialised Small and General Large Language Models on Text Classification” https://arxiv.org/abs/2402.12819

Kaplan et al., “Scaling Laws for Neural Language Models” https://arxiv.org/abs/2001.08361