Aftercasting
a16z

World Models, Robotics, and the Future of 3D AI

2026-09-13

World Labs 联合创始人 Justin Johnson 上 MTS(Theo Jaffee / Sofia Puccini)讲解 Atlas:面向物理世界的多模态世界模型,做生成、稀疏重建与仿真三条能力;相对上一代 Marble 打破「凡事过 Gaussian」瓶颈,让 2D 直出、按需升维 3D。重点用例包括创意飞穿世界,以及机器人 real-to-sim 最后一公里评估/微调;并暗示 VR 可能是导航与提示世界模型的自然界面。

  • World models = 视觉/物理理解横轴,补齐 LLM 的离散文本轴。
  • Atlas 三能力:生成 / 稀疏重建 / 仿真。
  • 相对 Marble:早分支 2D/3D,摆脱处处 Gaussian。

播出信息

来源

节目结构

  1. 论题:世界模型是语言模型之外的另一横轴 — 00:00 🎧 · ▶️
  2. 宣布 Atlas:模型发布而非产品发布 — 00:45 🎧 · ▶️
  3. 三大能力:生成、重建、模拟 — 01:30 🎧 · ▶️
  4. 与视频生成的差别:输出锚定在 3D — 04:00 🎧 · ▶️
  5. 相对 Marble:打破 Gaussian 瓶颈 — 08:00 🎧 · ▶️
  6. 实时漫游两条技术树 — 10:00 🎧 · ▶️
  7. Real-to-sim:机器人最后一公里 — 12:00 🎧 · ▶️
  8. 视频模型研究 vs 世界模型产品路径 — 14:00 🎧 · ▶️
  9. 控制感与作者性:生成必须「像你的」 — 18:00 🎧 · ▶️
  10. 子弹时间与 VR 导航;Marble 已在 VR — 20:00 🎧 · ▶️

分节详解

1) 论题:世界模型是语言模型之外的另一横轴

⏱ 00:00 🎧 · ▶️

💬 他们说了什么: Justin:LLM 是处理离散 token 流的通用引擎;World Labs 主张还存在一类基于视觉与物理理解的 world models,用于生成、模拟、重建世界,若足够通用可覆盖娱乐、VR、建筑、机器人等。我们生活在物理建成空间,需要模型帮我们处理它。

💡 为什么重要: 把「下一平台」从聊天框拉到空间智能,给 3D/机器人投资一个清晰类别标签。

⚡ 争议点: 「另一类别」是否与视频生成模型连续谱而非分立?后文会拆。

2) 宣布 Atlas:模型发布而非产品发布

⏱ 00:45 🎧 · ▶️

💬 主持 Theo/Sofia:World Labs 联合创始人 Justin 当日宣布 Atlas——多模态世界模型,像素级相机控制生成图像/视频并重建 3D。Justin 澄清:这是 base model 发布,产品稍后;Atlas 将驱动未来产品。

💡 管理预期:先能力底座,再产品化——避免把 demo 当 GTM。

无产品日的「发布」如何转化开发者生态?

3) 三大能力:生成、重建、模拟

⏱ 01:30 🎧 · ▶️

💬 Generation:从文本/图像提示生成从未存在的世界并飞穿相机。Reconstruction:稀疏重建——少至 1 张、多至 100+ 张照片重建真实空间,照片越多越准。Simulation:在重建空间里模拟物体/机器人行为,服务 VFX 与机器人。

💡 给出可记忆的产品能力三角形,直接映射创意与 robotics 两类买家。

「一张照片重建」精度与幻觉边界未量化。

4) 与视频生成的差别:输出锚定在 3D

⏱ 04:00 🎧 · ▶️

💬 强调帧不是漂浮 2D:被 grounding 在 3D 空间,可布置、控相机、做时间模拟。这与纯视频扩散「看起来像」不同,目标是可导航、可仿真的世界状态。

💡 为「为何不直接用 Sora 类模型」提供技术答案:可控几何与仿真接口。

代价是算力与延迟;实时性后文讨论。

5) 相对 Marble:打破 Gaussian 瓶颈

⏱ 08:00 🎧 · ▶️

💬 Marble 把 Gaussian splats 放在中心,视频/图像常经高斯场景再渲染。Atlas 全栈重建,让 2D/3D 分支更早:2D/视频可直接出像素,仅在需要时再 lift 到 3D;架构更统一、易扩展。

💡 展示第二代世界模型的架构教训:表示选择会锁死扩展路径。

放弃处处高斯是否损失部分 3D 一致性?

6) 实时漫游两条技术树

⏱ 10:00 🎧 · ▶️

💬 问到 Flight Simulator/Google Maps 级遍历:Justin 认为比预期快。Atlas 为两条树都准备:显式 3D(高斯/点云客户端插值)与直接流式出帧。内部工具已有类似 FPS 的空间画布,产品层仍需迭代暴露方式。

💡 投资人可跟踪的里程碑:流式帧 vs 显式场景哪个先产品化。

「 sooner than you expect」缺具体 SLA。

7) Real-to-sim:机器人最后一公里

⏱ 12:00 🎧 · ▶️

💬 对机器人:在最终工厂/场景做匹配仿真,用于评估与微调——即使有通用机器人基础模型,仍需对准具体环境。相对纯遥操作演示采集,仿真提供另一条数据与验证角度;也可 real→sim→real 适配特定桌面/麦克风等场景,用手机随手拍几段即可开建。

💡 把世界模型卖点钉在 robotics 的评估与适配瓶颈,而非只做炫酷生成。

仿真保真度与真机迁移误差仍是领域难题。

8) 视频模型研究 vs 世界模型产品路径

⏱ 14:00 🎧 · ▶️

💬 讨论基础研究上视频模型作为世界模型的路线,与 World Labs 强调可控相机/3D 重建的产品路径并置:不是否定视频模型,而是要可编辑、可仿真、可重建的接口。

💡 帮听众区分学术「world model」口号与可交付空间智能栈。

长期是否殊途同归未定。

9) 控制感与作者性:生成必须「像你的」

⏱ 18:00 🎧 · ▶️

💬 创意侧关键体验:若用户觉得生成不受控、不属于自己,就难付费留存。Atlas 强调像素级相机控制与空间画布,是在抢「作者性」而不只是随机惊喜。

💡 创意工具 PMF 往往取决于控制感 > 单次惊艳。

专业 VFX 管线集成深度仍未知。

10) 子弹时间与 VR 导航;Marble 已在 VR

⏱ 20:00 🎧 · ▶️

💬 聊到草莓击奶的子弹时间式镜头控制、以及用 VR 作为世界模型自然交互模态。Justin:Marble 已在 VR 近一年,戴上头显进入自己生成的世界「相当震撼」。收束展望 Atlas 全面开放后的创意爆发。

💡 闭环:交互前端可能是 VR/空间计算,而不只是时间线剪辑。

消费级 VR 渗透是否配得上模型野心?

金句

Language models process streams of discrete tokens — world models should be based in visual and physical understanding.

This is a model announcement, not a product launch — the base model will power future products.

Break the dependency of bottlenecking everything through a Gaussian splat scene.

来源(再列)