Aftercasting
Latent Space

The Inference Engineering Masterclass — Philip Kiely & Ali Taha, Baseten

2026-08-03

Baseten 双人谈推理工程:专有部署、推测解码、量化、并行与 mega kernel,以及视频/扩散等多模态服务——下一阶段 100× 可能来自推理栈而非只扩预训练。

  1. 推理是新杠杆
  2. 推测解码+量化+并行 三件套
  3. 开源上生产 要观测与护栏

The Inference Engineering Masterclass — Philip Kiely & Ali Taha, Baseten|深度中文详解

嘉宾:Philip Kiely & Ali Taha(Baseten) · 日期:2026-08-03(PT)


播出信息

  • 日期:2026-08-03(PT)
  • 嘉宾:Philip Kiely & Ali Taha(Baseten)
  • 时长:约 101 分钟(RSS=6089s)
  • 章节末段:1:40:06(约 99%)

节目结构(官方章节)

  1. 开场与 20 万 token 提示 — 00:00 🎧 · ▶️
  2. 专有部署、推测解码与工具调用 — 03:18 🎧 · ▶️
  3. 上线生产级开源模型 — 11:26 🎧 · ▶️
  4. 模型改装、失败模式与非确定性 — 19:06 🎧 · ▶️
  5. 量化与误差抵消 — 28:22 🎧 · ▶️
  6. 冲向 10× 更快推理 — 32:15 🎧 · ▶️
  7. Dynamo、推测与本地 vs 数据中心 — 40:48 🎧 · ▶️
  8. 模型并行、自动调参与巨型内核 — 50:18 🎧 · ▶️
  9. Rubin、GPU vs ASIC 与定制芯片 — 1:00:55 🎧 · ▶️
  10. 巨型模型与显存极限 — 1:10:03 🎧 · ▶️
  11. AI 视频、二次注意力与自回归生成 — 1:12:42 🎧 · ▶️
  12. 音频、图像与扩散模型 — 1:21:47 🎧 · ▶️
  13. 训练、自优化模型与持续学习 — 1:27:32 🎧 · ▶️
  14. 收束 — 1:40:06 🎧 · ▶️

分节详解

1) 开场与 20 万 token 提示 — 00:00 🎧 · ▶️

💬 他们说了什么: Baseten 的 Philip Kiely 与 Ali Taha 登场;用极端长提示引出推理工程议题。

💡 为什么重要: 定调:推理侧是下一阶段 100× 杠杆。

⚡ 争议点: 长提示示例是否代表性不足。

2) 专有部署、推测解码与工具调用 — 03:18 🎧 · ▶️

💬 专有部署形态;推测解码加速;工具调用对延迟与批处理的影响。

💡 生产推理的三大日常杠杆。

专有部署成本谁承担。

3) 上线生产级开源模型 — 11:26 🎧 · ▶️

💬 如何把开源模型推到可生产:护栏、限流、观测。

💡 开源≠可服务。

「生产级」标准是否厂商自定。

4) 模型改装、失败模式与非确定性 — 19:06 🎧 · ▶️

💬 改装/蒸馏失败模式;采样非确定性对评测与回归的折磨。

💡 工程现实常被研究论文省略。

非确定性是否被过度妖魔化。

5) 量化与误差抵消 — 28:22 🎧 · ▶️

💬 量化技巧与误差在层间抵消的直觉。

💡 压缩是推理成本核心。

精度掉点对安全域不可接受。

6) 冲向 10× 更快推理 — 32:15 🎧 · ▶️

💬 行业竞速 10×;内核、调度、批处理联合作战。

💡 设定性能叙事。

基准是否 cherry-pick。

7) Dynamo、推测与本地 vs 数据中心 — 40:48 🎧 · ▶️

💬 NVIDIA Dynamo 等栈;本地端侧 vs 数据中心权衡。

💡 架构分叉将长期存在。

端侧隐私叙事 vs 能力缺口。

8) 模型并行、自动调参与巨型内核 — 50:18 🎧 · ▶️

💬 张量/流水线并行;自动调参;mega kernel 减少启动开销。

💡 系统栈深度决定差距。

自动调参稳定性。

9) Rubin、GPU vs ASIC 与定制芯片 — 1:00:55 🎧 · ▶️

💬 下一代 GPU(Rubin 等)与 ASIC 定制;何时自研芯片。

💡 资本密集度上升。

ASIC 锁定风险。

10) 巨型模型与显存极限 — 1:10:03 🎧 · ▶️

💬 权重/KV 显存墙;分层卸载与多机。

💡 规模化物理极限。

「只要更多 GPU」简化。

11) AI 视频、二次注意力与自回归生成 — 1:12:42 🎧 · ▶️

💬 视频生成的二次注意力爆炸;自回归路线取舍。

💡 多模态推理成本结构性更高。

路线尚早下定论。

12) 音频、图像与扩散模型 — 1:21:47 🎧 · ▶️

💬 音频/图像/扩散服务差异:批、缓存、调度。

💡 扩展推理工程版图。

扩散服务经验能否迁移 LLM。

13) 训练、自优化模型与持续学习 — 1:27:32 🎧 · ▶️

💬 训练与推理闭环;模型自优化、持续学习前景。

💡 指向「推理反馈训练」。

持续学习稳定性未解。

14) 收束 — 1:40:06 🎧 · ▶️

💬 收束:推理工程是 AI 工程师主战场之一。

💡 行动号召。

是否低估数据/产品瓶颈。

金句

  • 下一 100× 更可能来自推理与网络,而不只是更大预训练。
  • 量化不是免费午餐,但误差有时可被结构抵消。

来源