The data black hole at the center of AI

编译摘要

1. 浓缩

  • 核心结论 1: 智能的关键定义之一是样本效率(Sample Efficiency),而目前的 AI 模型相比人类在样本效率上面临几个数量级(3到6个数量级)的巨大鸿沟,其能力进步主要依赖海量数据分布的拓宽和算力提升(如强化学习用于合成数据生成),而非样本效率的质变。

    • 关键证据: 人类在一生从出生到成年平均仅接触约 2 亿 tokens 的语言数据,而前沿大模型需要 10 万亿到 100 万亿以上的 tokens,两者相差近百万倍。
    • 关键证据: 人类学习机器人手臂操纵仅需几小时,而 AI 机器人在海量数据下依旧难以完成开放性任务。人类学习驾驶仅需 20 小时,而 Tesla/Waymo 自驾模型需要数万倍于此的数据量。
    • 关键证据: 前沿模型在微调与 RL 阶段,为了学习特定技能,依然高度依赖像 Mercor 或 Surge 网站上提供的极其 domain-specific、昂贵的专家数据(数百名专家产出标注、 rubrics 与思考链)。
  • 核心结论 2: 当前开源模型与闭源最顶尖模型之间仅有约 4 个月的延迟,这表明数据(特别是能通过公开 API 蒸馏的数据)是目前推动 AI 进步的真实核心驱动力,而保密的超参数或训练技巧并非首要壁垒。

    • 关键证据: Epoch 报告开源模型仅落后前沿闭源模型 4 个月。因为公开 API 数据极易被蒸馏,导致其他实验室追赶极快;若是微调技巧或网络架构等私密知识主导,追赶速度将不会如观察到的这般迅速。
  • 核心结论 3: AI 极其低效的样本效率在经济学上是完全可以被容忍的,因为高昂的前置训练数据与计算成本可以被摊销(Amortized)并在数十亿次的用户会话(Sessions)中近乎零边际成本地复制复用,这颠覆了人类劳动力无法复制的经济模式。

    • 关键证据: 培养人类专家需要极长的时间和教育成本,且每个专家一次只能干一份活;而大模型一旦训练出权重,便可以无摩擦地分发、无限复制,从而在商业上带来巨大的净收益。

2. 质疑

  • 关于“人类拥有进化作为预训练权重”的反驳与质疑:

    • 边界条件: 许多人认为人类基因有进化史的积累,因而与冷启动 AI 相比不公平。作者认为人类基因组仅 3GB 且大部分是非编码区,不足以存储万亿级的参数权重;进化的核心是确定了损失函数和超参数,具体的连接权重(训练)依然是在个体生命期内以高样本效率完成的。
    • 反例: 进化的成果可能不仅仅是简单的损失函数,还包括了极度优化的底层物理/认知“先验(Priors)”和脑结构。这种物理世界的强归纳偏置使得大脑在极少数据下能进行高效概括,而大模型冷启动需要用海量数据去“撞击”出这些先验。
  • 关于“数据分摊(Amortization)”的边界条件:

    • 边界条件: 数据成本能无限分摊的假设,建立在任务可以被“标准化”、“通用化”并保持高频调用的前提下。
    • 反例: 一旦面对极度动态、高度长尾、超出分布(OOD)且容错率极低的现实世界任务,模型就需要频繁重新标注定制数据进行 RL 微调或引发高昂的人类干预成本,此时分摊公式在经济上可能会断裂。
  • 关于“开源/闭源模型差距仅 4 个月”的归因:

    • 边界条件: 只要闭源模型的产出能够通过 API 轻易获取并被当做标注源,这种蒸馏 catch-up 就有效。
    • 反例: 如果前沿实验室未来将大部分能力构建于封闭的、外界无法通过简单 API 结果蒸馏的高成本交互式强化学习(RL)或私有 Verifier 上,开源模型的蒸馏追赶效应可能会遭遇天花板,代差可能会重新被拉大。

3. 对标

  • 跨域关联 1 (认知科学与机器学习): 机器学习的样本效率与人类认知心理学中的“少样本学习(Few-shot learning)”相对照。AI 表现出的多才多艺在底层其实是由“一万个特化任务专家”(Franksenstein's monster with a billion grafts of carefully constructed examples)缝合而成的,而人类通用智能表现出极强的概念迁移与低样本泛化。这可与 World-Model 概念对照
  • 跨域关联 2 (软件与资源经济学): 摊销智能(Amortized Intelligence)的经济模型类似传统软件的“高固定成本,零边际成本”规律,但 AI 的前置固定成本(数据黑洞)被拉到了极致。这与 AI-Era-Economy-ShiftAllocation-Economy 直接相关:当生成变得极度廉价且可无限复制时,真正的稀缺变成了对这些摊销智能的配置、评估与对齐管理。
  • 跨域关联 3 (软件工程中的 OOD 处理): 白领工作(如软件工程)中大部分是 common tasks(可被数据分布覆盖),但最困难的部分在于动态的 OOD(分布外)开发。人类的高样本效率和概念建模优势使人类适合扮演 Model Manager。这可与 AI-Labor-Bottleneck-Shift 以及 Allocation-Economy 对照

关联概念