Inference-Engineering(推理工程)

定义

推理工程(Inference Engineering):把训练好的权重变成快、可靠、可负担、能规模化服务产品的工程学科,独立于模型训练。来源:Philip Kiely《Inference Engineering》(Baseten,2026)。三年前几乎不存在,如今是 AI Infra 的核心品类(Baseten 以此成为 $13B decacorn)。

核心技术栈

技术机制解决的问题
Cache-aware routing复用已算过的 KV cache,跳过 prefill长上下文(如 200K token 的 agent 请求)的重复计算
Prefill/decode 分离一组 GPU 处理输入生成 KV cache 与首 token,另一组迭代解码两种工作负载的异构资源需求
Speculative decoding小草稿模型快跑预测、大模型一次验证接受/拒绝逐 token 串行解码的墙
量化校准权重降精度(如 NVFP4),层间误差可相互抵消内存与吞吐
结构化输出状态机构束输出格式(如 JSON)tool calling 的格式幻觉

两个关键区分

  1. "能吐 token" ≠ "产品级 API":开源栈(vLLM/SGLang)让"跑出 token"变容易,但产品级支持需重做量化校准、训练 traffic 定制的 speculator、为新架构(GLM-5.2 稀疏注意力、DeepSeek novel 架构)扩展 runtime。
  2. 开源模型可拼接:冻结主体权重、只训练小 adapter(projector),可把 Kimi 视觉 encoder 嫁接到 GLM-5.2 上——纯文本输入时行为不变。这是封闭 API 无法提供的模块化自由度。

与知识库主线的接合

  • 推理工程是 token 供应链 的底层实现:KV cache 管理、推理调度、成本路由的工程实体。
  • speculative decoding(小模型起草、大模型验证)是 生成-验证不对称 在推理层的解法。
  • "能吐 token 到产品级"的鸿沟是 部署隐性成本 的推理侧版本。
  • 训练与推理正在收敛:模型帮助优化运行自己的 kernels,持续学习与 KV cache compaction 使二者边界模糊。

关键数据点

  • Baseten 以推理工程完成 $13B Series F,成为 AI Infra decacorn
  • GLM-5.2 实验:量化更多反而保住 benchmark 质量 + 吞吐 +20%(层间误差抵消)
  • 推理优化增益范围 20%/100%/200%,目标让前沿模型提速至 10×

前提与局限性

  • 主要证据来自 Latent Space 播客(Baseten 厂商视角),"20%/100%/200% 增益、10× 加速"属语境依赖的营销性表述。
  • "量化误差相互抵消"目前是单一 GLM-5.2 实验的轶事。
  • 模型改造/拼接是研究项目级成果(MMLU Pro 56%,非 frontier),真实产品受 license/评测/稳定性约束。

关联概念