当 AI 开始查数——Anthropic 的 95% 自动化给我们的真正教训

Anthropic 最近公开了一组数字:公司内部 95% 的业务分析查询已经由 Claude 自动完成,准确率约 95%。数据科学团队腾出手去做因果建模、预测和机器学习,不再被 ad-hoc 取数淹死。
这个数字当然漂亮。但我读完他们整篇技术博客之后,印象最深的不是 95%,而是另一个数字:没有 skills 的时候,Claude 回答分析问题的准确率不超过 21%。
从 21% 到 95%,差的不是模型。差的是他们怎么重新想了一遍”数据该怎么管”这件事。
数据不是代码
Section titled “数据不是代码”写代码的 agent 有天然护栏——测试不过就是不过,编译器会告诉你错在哪。但查数的 agent 面对的是完全不同的局面:一个问题只有一个正确答案,但没有确定性方式验证它。
“上个月的收入是多少?”
听起来简单。但在一个正常生长的数据仓库里,“收入”至少有四个版本——账面收入、扣除退款后的净收入、扣除退款和折扣后的净收入、匹配财务月结的确认收入。agent 选哪个?它不知道。它只是从几百万个字段里挑了一个看起来最像的,然后返回一个自信的数字。
Anthropic 把这叫”概念-实体歧义”。这不是 agent 笨,是你的数据环境给了它太多犯错的选项。

三层失败,一层解法
Section titled “三层失败,一层解法”Anthropic 把失败归纳为三类:概念-实体歧义、数据过时(schema 和定义天天变,agent 的认知跟不上)、检索失败(答案明明在某个表里,搜索空间太大就是找不到)。
这三类的共同根源不是 AI 不够好。是你的数据环境又模糊又旧,agent 想找也找不到。
所以他们搭了一个四层的 agentic 数据栈。底下两层——数据基础和语义层——是给老数据工程师看的,说白了就是:把表砍少、把定义管死、把元数据当产品维护。上面两层——skills 和验证——才是给 AI 时代加的新东西。
skills 是 agent 的程序性知识:先查哪个源、怎么处理歧义数据、一个完整的分析长什么样。验证层则负责抓漏网之鱼:离线评估套件、对抗性审查子 agent、答案来源页脚——告诉你这个数字是从语义层出来的还是从原始表手搓的。

最贵的实验是失败的实验
Section titled “最贵的实验是失败的实验”整篇博客里最有价值的一段,是他们做的 ablation 实验。
他们把几千个历史 SQL 文件——dashboard 查询、分析师 notebook、ETL 脚本——全部开放给 agent 直接检索。按理说这应该是金矿:每个问题都有人答对过,agent 只要找到那个正确答案就行。
结果准确率几乎没有变化。正负不到一个百分点。
他们又检查了:错的问题里,80% 在语料库里确实有正确答案。但 agent 看到了也没用上。
这个实验告诉他们的东西比任何成功案例都值钱:瓶颈不是信息获取,是结构化。 agent 缺的不是更多数据,缺的是一座能把”这个月的活跃用户”映射到那一张表的那一列的桥。
这个发现让他们把几个月的路线图转了方向。从”给 agent 更多数据”转向”把数据治理到 agent 能用”。
治理不是成本,是杠杆
Section titled “治理不是成本,是杠杆”Rittman Analytics 的 Mark Rittman 在读完 Anthropic 这篇博客后写了一篇 22 分钟的长文分析,里面有一句话我反复看了三遍:
“花在治理数据上的钱,回报远高于花在追逐更聪明模型上的钱。”
这不是直觉。我们的直觉是 AI 不够聪明所以出错,所以等下一代模型就好了。但 Anthropic 的数据说:无 skills 时 21%,有 skills 时 95%+——这个跳跃跟模型版本无关。他们又做了一个实验:不给 skills 维护,一个月后准确率从 95% 掉到 65%。同样没换模型,只是文档过时了。
这意味着什么?
意味着如果你正在给公司搭 AI 分析系统,现在就该做的事情不是等 Opus 5,而是回头把你仓库里那四十张收入表砍到一张,把那三套互相矛盾的活跃用户定义统一,把”这个字段是什么意思”写下来放在 agent 能读到的地方。
这是反直觉的。我们习惯了模型越来越强,以为耐心等就行。但 Anthropic 的数据告诉你:治理的杠杆比模型的杠杆大得多。 你的数据环境如果不治理,再强的模型也只能在你埋的雷区里猜。
维护是硬核工程问题
Section titled “维护是硬核工程问题”还有一个让我警醒的点:他们把 skill 文件和 dbt 模型放在同一个 git 仓库里。
不是”文档写好就完了”。是 PR 改了模型就必须同步改 skill 文件,CI 会拦住没更新文档的变更。90% 的数据模型 PR 现在都包含一个 skill 文件改动。
这是把”写文档”从美德变成了工程约束。美德可以懈怠,约束不能。
维护的代价如果不付,一个月就能从 95% 跌到 65%。付了,就是持续 95%+。没有中间态。
沉默的错误最难抓
Section titled “沉默的错误最难抓”Anthropic 坦率承认了一个他们还没解决的问题:沉默的失败。答案错了、但看起来合理、没人提出异议——这种错误他们目前的手段检测不到。来源页脚能帮用户判断可信度,人工签核能拦住最关键的决策,但都不是系统性解法。
读到这里我楞了一下:这不只是分析领域的问题。agent 越强,错误越难被发现——因为错误也跟着变强了。以前错得明显,改得快。现在错得微妙,裹在看起来挺对的推理链里。
这个问题没有银弹。但 Anthropic 至少给了一个方向:把”不知道”标出来比假装知道强。
你所在团队的数据环境中,同一个业务概念(如”活跃用户""收入""留存率”)有多少套不同的定义和实现?如果让 AI agent 去查,它选对的概率大概是多少?
Chen Chang, Clement Peng, Justin Leder, Johanne Jiao, Josh Cherry. How Anthropic enables self-service data analytics with Claude. Anthropic Blog, June 2026. https://claude.com/blog/how-anthropic-enables-self-service-data-analytics-with-claude