How Anthropic enables self-service data analytics with Claude
编译摘要
1. 浓缩
- 核心结论 1: 自助数据分析的瓶颈不是 SQL 生成,而是把业务问题映射到正确、最新、可治理的数据语义。
- 关键证据: Anthropic 指出,直接把 Claude 接到数据仓库会制造“精确错觉”;分析任务通常只有一个正确答案,关键是找对实体、指标、数据模型和使用方式。
- 核心结论 2: 可靠的 analytics agent 需要数据基础、语义层、skills、评测和在线校正共同构成 harness。
- 关键证据: 体系包括 canonical datasets、semantic layer、lineage graph、query corpus distillation、company knowledge graph、domain skills、dashboard evals、长尾 evals、correction harvesting 和 CI。
- 核心结论 3: 结构化知识比原始语料访问更重要。
- 关键证据: 给 agent 访问数千个历史 SQL 文件只让准确率提升不到 1 个百分点;80% 错误答案的答案其实存在于 corpus 中,但 agent 没有正确使用。没有 skills 时准确率不超过 21%,有 skills 后整体超过 95%,部分 domain 接近 99%。
- 核心结论 4: 知识维护必须进入工程流程,否则 analytics skill 会快速腐烂。
- 关键证据: Anthropic 称 skills 若不维护,准确率可能一个月从约 95% 掉到约 65%;他们把 skill markdown 与数据转换代码 colocate,并用 code review hook 要求 reporting model 变更同步改 skill,约 90% 数据模型 PR 包含 skill 变更。
2. 质疑
- 关于可迁移性的质疑: Anthropic 具备高模型能力、强工程文化、内部数据规范和业务团队配合;普通企业复制时最大风险是低估 canonical datasets 和评测维护成本。
- 关于准确率的质疑: 95% aggregate accuracy 很有价值,但 aggregate 可能掩盖高风险指标、低频长尾和沉默失败;原文也承认 silent failures 仍未完全解决。
- 关于 skills 的质疑: Skills 提升巨大,但也会成为新型技术债;如果维护流程没有和数据模型变更绑定,文档腐烂会把错误固化进 agent 行为。
3. 对标
- Context Engineering: 该文把 Context-Engineering 从“喂更多上下文”升级为“设计可验证语义入口”。原始 warehouse、历史 SQL 和松散文档不是上下文工程,canonical semantic layer + skills + evals 才是。
- Enterprise AI Learning Gap: Anthropic 的 correction harvesting、skill PR、telemetry 和 CI 是跨过 Enterprise-AI-Learning-Gap 的具体机制。
- LLM Wiki / Fat Skills: 该文与 Thin-Harness-Fat-Skills 呼应:agent harness 可以薄,但 domain skills 必须承载经过编译的业务程序性知识。
关联概念