这集讲什么
在这期播客中,Modal 的 CTO Akshat Bubna 详细探讨了 AI 基础设施如何演变以支持代理体验(Agent Experience),并分享了 Modal 在云计算、GPU 工作负载和开发者体验方面的创新。
值得看吗?
值得快速扫一遍:有时间戳议程与分节详解,可按兴趣跳听。
1-3要点
- AI 基础设施的演变:Modal 通过改进开发者和代理体验,推动 AI 基础设施的演变,以支持更复杂和大规模的应用。
- 弹性推理和 GPU 快照:这些技术创新提高了 AI 应用的效率和响应速度,特别是在需要大规模计算资源的情况下。
- 开放模型和实时 AI:推动 AI 应用创新的重要因素,能够帮助企业更快地适应市场变化。
Why AI Infrastructure must evolve for Agent Experience — Akshat Bubna, Modal CTO
播出信息
- 日期:2026-07-08
- 嘉宾:Akshat Bubna(Modal CTO)
- 场合:播客访谈
背景
Modal 是一家专注于 AI 应用的云平台公司,提供从推理到训练、批处理和沙盒工作负载的基础设施服务。随着 AI 技术的快速发展,Modal 致力于通过改进开发者和代理体验来满足不断变化的市场需求。
节目结构 / 议程
- Introduction: Modal, Series C, and the Art Party — 00:00 🎧 · ▶️
- Modal’s origin and why Kubernetes wasn’t enough — 00:39 🎧 · ▶️
- Developer Experience → Agent Experience — 04:32 🎧 · ▶️
- Modal’s AI cloud primitives — 06:21 🎧 · ▶️
- Sandboxes, agent loops, and proto-Cognition — 09:14 🎧 · ▶️
- Elastic inference, GPU snapshotting, and 100,000 sandboxes — 12:12 🎧 · ▶️
- DeFlash, speculative decoding, and Auto Endpoints — 15:24 🎧 · ▶️
- Production-grade inference beyond raw GPUs — 19:59 🎧 · ▶️
- Background agents, Ramp Inspect, and the agent lifecycle — 22:00 🎧 · ▶️
- Modal’s 17-cloud supercloud strategy — 24:08 🎧 · ▶️
- Networked sandboxes, private IPv6, and RDMA — 26:40 🎧 · ▶️
- Multi-node training, post-training, and auto research — 32:48 🎧 · ▶️
- Compute strategy, capacity planning, and batch tiers — 37:36 🎧 · ▶️
- Open models, real-time AI, and production agent infra — 40:55 🎧 · ▶️
- Hard guardrails, managed agents, and specialized sandboxes — 43:06 🎧 · ▶️
- Why AI made infrastructure exciting again — 46:06 🎧 · ▶️
- Model APIs, differentiated products, and agentic video — 48:30 🎧 · ▶️
- CI, coding-agent infra, SDKs, and Modal Bench — 51:50 🎧 · ▶️
- Closing Thoughts — 57:28 🎧 · ▶️
分节详解
1) Introduction: Modal, Series C, and the Art Party — 00:00 🎧
💬 他们说了什么: 主持人 Swyx 祝贺 Akshat 和 Modal 团队成功完成了 C 轮融资,并提到他们的派对非常精彩,充满了艺术装置。Akshat 回忆起 Modal 的起源,最初并不是一家 GPU 推理公司,而是一个新的运行时构想。 — 00:00 🎧
💡 为什么重要: 这段介绍为听众提供了 Modal 的背景信息,展示了公司从起步到现在的成长历程,以及他们在技术和文化上的创新。
⚡ 争议点: 无明显争议点。
2) Modal’s origin and why Kubernetes wasn’t enough — 00:39 🎧
💬 Akshat 解释了 Modal 的起源,指出 Kubernetes 在处理突发性和自定义镜像时的局限性。Modal 的目标是创建一个更好的运行时,以改善开发者体验。 — 00:39 🎧
💡 了解 Modal 的起源和发展方向有助于理解他们在技术选择上的决策,尤其是在云计算和 AI 应用领域。
⚡ Kubernetes 的局限性是否足以推动创建一个全新的运行时?
3) Developer Experience → Agent Experience — 04:32 🎧
💬 Akshat 提到 Modal 的 SDK 团队已经从关注开发者体验转向关注代理体验(Agent Experience),因为代理也需要快速、动态的运行时环境。 — 04:32 🎧
💡 这反映了技术发展的趋势,即从传统的开发者工具转向支持自动化和智能代理的工具。
⚡ 代理体验是否真的能替代开发者体验成为新的重点?
4) Modal’s AI cloud primitives — 06:21 🎧
💬 Akshat 描述了 Modal 的云平台如何为 AI 应用构建基础设施原语,涵盖推理、训练、批处理和沙盒工作负载。 — 06:21 🎧
💡 这些基础设施原语是支持 AI 应用的关键,能够帮助企业更高效地进行 AI 模型的开发和部署。
⚡ Modal 的平台是否能在竞争激烈的云服务市场中脱颖而出?
5) Sandboxes, agent loops, and proto-Cognition — 09:14 🎧
💬 Akshat 讨论了 Modal 如何通过沙盒和代理循环来支持 AI 应用的开发,并提到早期的 smol developer 项目如何成为原型认知的基础。 — 09:14 🎧
💡 沙盒和代理循环是现代 AI 应用的重要组成部分,能够支持复杂的任务自动化和自我改进。
⚡ 沙盒技术的广泛应用是否会带来安全性和隐私方面的挑战?
6) Elastic inference, GPU snapshotting, and 100,000 sandboxes — 12:12 🎧
💬 Akshat 介绍了 Modal 在弹性推理和 GPU 快照方面的创新,强调了在不同区域的自动扩展能力。 — 12:12 🎧
💡 这些技术创新能够显著提高 AI 应用的效率和响应速度,特别是在需要大规模计算资源的情况下。
⚡ 弹性推理和 GPU 快照技术的实现是否会增加系统的复杂性和维护成本?
7) DeFlash, speculative decoding, and Auto Endpoints — 15:24 🎧
💬 Akshat 讨论了 Modal 在推理性能优化方面的工作,包括 DeFlash 和推测解码技术,以及如何通过自动端点实现前沿性能。 — 15:24 🎧
💡 推测解码和自动端点是提高 AI 模型推理效率的重要技术,能够帮助企业更快地响应市场需求。
⚡ 推测解码技术是否会影响模型的准确性和可靠性?
8) Production-grade inference beyond raw GPUs — 19:59 🎧
💬 Akshat 强调了 Modal 在生产级推理方面的优势,特别是在弹性和可扩展性方面。 — 19:59 🎧
💡 生产级推理是 AI 应用成功的关键,能够支持大规模的实时数据处理和分析。
⚡ Modal 的生产级推理解决方案是否能与其他云服务提供商的产品竞争?
9) Background agents, Ramp Inspect, and the agent lifecycle — 22:00 🎧
💬 Akshat 介绍了 Modal 的背景代理和 Ramp Inspect 项目,强调了代理生命周期管理的重要性。 — 22:00 🎧
💡 代理生命周期管理是确保 AI 应用稳定性和持续性能的关键,能够帮助企业更好地管理和优化其 AI 资源。
⚡ 代理生命周期管理是否会增加系统的复杂性和管理负担?
10) Modal’s 17-cloud supercloud strategy — 24:08 🎧
💬 Akshat 描述了 Modal 的超级云策略,利用 17 个云提供商的资源来实现全球范围内的计算能力。 — 24:08 🎧
💡 超级云策略能够提供更高的灵活性和可靠性,帮助企业在全球范围内部署和管理其 AI 应用。
⚡ 依赖多个云提供商是否会带来兼容性和集成方面的挑战?
11) Networked sandboxes, private IPv6, and RDMA — 26:40 🎧
💬 Akshat 讨论了 Modal 在网络沙盒和私有 IPv6 网络方面的创新,以及 RDMA 技术在分布式训练中的应用。 — 26:40 🎧
💡 网络沙盒和私有网络能够提高 AI 应用的安全性和性能,特别是在需要高效数据传输的情况下。
⚡ 私有网络和 RDMA 技术的使用是否会增加系统的复杂性和成本?
12) Multi-node training, post-training, and auto research — 32:48 🎧
💬 Akshat 介绍了 Modal 的多节点训练和自动研究功能,强调了在后训练阶段提高模型质量的重要性。 — 32:48 🎧
💡 多节点训练和自动研究能够帮助企业更高效地优化其 AI 模型,提高模型的准确性和性能。
⚡ 自动研究功能是否会导致对 AI 模型的过度依赖,降低人类专家的作用?
13) Compute strategy, capacity planning, and batch tiers — 37:36 🎧
💬 Akshat 讨论了 Modal 的计算策略和容量规划,介绍了批处理层的概念,以提供更具成本效益的计算资源。 — 37:36 🎧
💡 计算策略和容量规划是确保 AI 应用高效运行的关键,能够帮助企业更好地管理其计算资源。
⚡ 批处理层的引入是否会影响实时应用的性能和响应速度?
14) Open models, real-time AI, and production agent infra — 40:55 🎧
💬 Akshat 讨论了开放模型和实时 AI 的重要性,以及 Modal 在生产代理基础设施方面的创新。 — 40:55 🎧
💡 开放模型和实时 AI 是推动 AI 应用创新的重要因素,能够帮助企业更快地适应市场变化。
⚡ 开放模型的使用是否会带来安全性和知识产权方面的风险?
15) Hard guardrails, managed agents, and specialized sandboxes — 43:06 🎧
💬 Akshat 强调了硬性防护措施和托管代理的重要性,并介绍了 Modal 的专用沙盒解决方案。 — 43:06 🎧
💡 硬性防护措施和专用沙盒能够提高 AI 应用的安全性和稳定性,特别是在处理敏感数据时。
⚡ 硬性防护措施是否会限制系统的灵活性和创新能力?
16) Why AI made infrastructure exciting again — 46:06 🎧
💬 Akshat 讨论了 AI 技术如何重新激发了对基础设施的兴趣,强调了大规模计算需求对基础设施创新的推动作用。 — 46:06 🎧
💡 AI 技术的快速发展推动了基础设施的创新,能够支持更大规模和更复杂的应用。
⚡ 基础设施的快速发展是否会导致技术债务和管理挑战?
17) Model APIs, differentiated products, and agentic video — 48:30 🎧
💬 Akshat 讨论了模型 API 和差异化产品的重要性,以及代理视频在未来 AI 应用中的潜力。 — 48:30 🎧
💡 模型 API 和差异化产品能够帮助企业在竞争激烈的市场中脱颖而出,代理视频则代表了 AI 应用的一个新兴领域。
⚡ 模型 API 的广泛使用是否会导致市场的同质化,降低创新能力?
18) CI, coding-agent infra, SDKs, and Modal Bench — 51:50 🎧
💬 Akshat 介绍了 Modal 在持续集成、编码代理基础设施和 SDK 方面的工作,以及 Modal Bench 的推出。 — 51:50 🎧
💡 这些工具和平台能够提高开发效率,支持更快速的产品迭代和创新。
⚡ 持续集成和编码代理基础设施的广泛使用是否会导致对自动化工具的过度依赖?
19) Closing Thoughts — 57:28 🎧
💬 Akshat 总结了 Modal 的发展历程和未来方向,强调了专注和执行力在公司成功中的重要性。 — 57:28 🎧
💡 这段总结为听众提供了对 Modal 未来发展的洞见,以及公司在技术创新和市场竞争中的定位。
⚡ 无明显争议点。
人物与机构
- Akshat Bubna:Modal CTO
- Swyx:播客主持人
- Vibhu:播客嘉宾
数字与证据
- Modal 使用 17 个云提供商的资源来实现全球范围内的计算能力。
- 在沙盒中,有时需要 100,000 个沙盒来支持大规模的 AI 应用。
金句
- "We’ve changed our SDK team to think about agent experience instead of developer experience." — 我们已经将 SDK 团队的关注点从开发者体验转向代理体验。
- "Modal is a cloud platform that’s built for AI applications." — Modal 是一个为 AI 应用构建的云平台。
洞见与延伸背景
【背景补充】AI 技术的快速发展对基础设施提出了更高的要求,推动了云计算和大规模计算资源的创新。Modal 的超级云策略和弹性推理技术正是应对这一挑战的解决方案。
争议与需核实
- Kubernetes 的局限性是否足以推动创建一个全新的运行时?
- 推测解码技术是否会影响模型的准确性和可靠性?
行动建议
- 企业应关注 AI 基础设施的演变,以支持更复杂和大规模的应用。
- 考虑采用弹性推理和 GPU 快照技术,以提高 AI 应用的效率和响应速度。
来源
- official_en_transcript
- latent.space