Aftercasting
a16z Show

Fei Fei Li: The Race to Build World Models For AI

2026-09-0443:43人工智能科技

这集讲什么

World Labs 发布 Atlas 模型——首个统一 3D 重建与生成的世界模型,通过 New View Prediction 实现从 3 张照片重建完整 3D 场景,将空间智能推向 AI completeness 的新边界。

值得看吗?

值得快速扫一遍:有时间戳议程与分节详解,可按兴趣跳听。

1-3要点

  • New View Prediction = Next Token Prediction 的空间等价物:Atlas 提出的新原语,与 LLM 处于同等基础地位
  • 重建与生成必须统一:计算机视觉分裂半世纪的两大 track 在 Atlas 中首次融合,实现几何精确性 + 创造性
  • Sparse 重建是数据经济学革命:从 300 张照片到 3 张照片的 100 倍数据效率,解锁互联网存量图像、消费者随手拍

Fei Fei Li: The Race to Build World Models For AI|深度中文详解

播出信息

背景

World Labs 由斯坦福 AI 实验室前负责人 Fei-Fei Li(李飞飞)创立,专注于 空间智能(Spatial Intelligence) 这一 AI 新边疆。2024 年公司推出 Marble 世界模型(输出 Gaussian Splat 3D 场景),2026 年 9 月发布的 Atlas 标志着根本性架构突破:从传统的"下一帧预测"转向 "新视角预测"(New View Prediction),首次在单一模型中统一了计算机视觉领域分裂半个世纪的两大任务——3D 重建与像素生成。

本期播客在 Atlas 发布次日录制,三位核心创始人首次详解技术原理:Justin(模型负责人)、Ben Mildenhall(NeRF 发明人)、Fei-Fei Li。对话覆盖从架构设计到 scaling hypothesis、从电影特效到机器人仿真、从当前能力到 AI completeness 的哲学思考。


节目结构 / 议程

  1. Atlas 模型发布:新一代世界模型的三大能力 — 00:00 🎧 · ▶️
  2. 核心创新:New View Prediction 与 Spatial Context — 03:00 🎧 · ▶️
  3. 统一重建与生成:从计算机视觉的分裂到融合 — 07:15 🎧 · ▶️
  4. Sparse 重建突破:从 300 张照片到 3 张照片 — 13:12 🎧 · ▶️
  5. 创意应用:从电影特效到建筑设计 — 20:25 🎧 · ▶️
  6. 机器人革命:Real-to-Sim 与动态世界模拟 — 28:55 🎧 · ▶️
  7. 未来方向:动态、可编辑性与多模态控制 — 35:24 🎧 · ▶️
  8. 哲学高度:New View Prediction 的 AI Completeness — 40:28 🎧 · ▶️

分节详解

1) Atlas 模型发布:新一代世界模型的三大能力 — 00:00 🎧 · ▶️

💬 他们说了什么:

Justin 开场直接定义 Atlas 的三大核心能力:生成(generation)重建(reconstruction)模拟(simulation)。具体表现为:

  • 相机条件生成:输入图像 + 相机轨迹,沿任意视角生成视频帧
  • 稀疏 3D 重建:1-100 帧输入即可重建真实世界(输出视频或显式 3D)
  • 仿真能力:展示了"子弹时间"视频(Bullet Time,致敬《黑客帝国》)和机器人仿真

关键演示案例:传统《黑客帝国》需要环形布置数百台相机 + 绿幕棚拍,Atlas 只需 3 部 iPhone 三脚架视频,无需棚拍、绿幕或昂贵校准,即可生成冻结时间的环绕镜头(如篮球入框、草莓落入牛奶的慢动作飞行镜头)。

💡 为什么重要:

这是首次有模型将 极少输入(3 张照片)工业级输出质量 结合。传统密集重建需要数百张照片覆盖每个角落(Ben 后续提到单个房间可能需要 200-300 张),Atlas 实现了 50-100 倍数据效率提升。这不仅降低创作门槛,更重要的是改变了数据采集的经济学——互联网现存图像、消费者随手拍的照片都可能成为 3D 重建的原材料。

⚡ 争议点:

  • 质量边界未明确:演示案例精心挑选(篮球、草莓等动态对象清晰),但对于复杂遮挡、反光材质、细节纹理的鲁棒性未充分展示
  • "仿真"定义模糊:仿真(simulation)在机器人领域特指物理精确的动态模拟,但此处 Atlas 展示的更多是视觉插值,物理准确性存疑

2) 核心创新:New View Prediction 与 Spatial Context — 03:00 🎧 · ▶️

💬

Justin 提出 Atlas 的最根本原语(primitive)New View Prediction(新视角预测)——这与 LLM 的"下一个 token 预测"、视频模型的"下一帧预测"处于同等地位。

工作流程:

  1. 输入任意数量的视角(图像或视频)+ 场景描述
  2. 构建 Spatial Context(空间上下文)——隐式描述"我们要讨论的世界是什么"
  3. 在任意时空点放置虚拟相机,Atlas 理解该位置应该"看起来像什么"

Ben 强调 Spatial Context 的关键性:与其他视频模型的 20-50 张图像"omni-reference"不同,Atlas 的每一帧都有关联的 3D 相机姿态(camera pose)。这意味着:

  • 精确重建:4 个房间角落的视角能精确复现整个房间,不会"猜测"另一个角落的内容
  • 创意导演:可以从不同 AI 生成图像或真实地点提取场景,通过精确定位相机实现"定向飞行穿越"
  • 摆脱老虎机效应:不再需要像文本驱动视频模型那样反复重试生成(slot machine effect)

💡

这是 语义控制几何控制 的范式跃迁。传统视频模型依赖文本 prompt"争论"让模型做某事,结果不可控;Atlas 通过精确的相机姿态实现 确定性生成。这类似于从"对 AI 说话"进化到"用精确工具操作 AI"。

更深层意义:Spatial Context 本质上是一个 世界状态的压缩表示,类比 LLM 的 KV cache。随着上下文窗口扩展(Ben 提到从几张到 64 张),模型能够维护越来越大规模的一致性世界。

  • 相机姿态的获取成本:普通用户如何提供精确的 camera pose?是否需要专业设备(如 LiDAR)或依赖 SLAM 算法?如果后者,误差会如何传播?
  • "隐式"的不可解释性:Spatial Context 是黑盒表示,当模型出错(如几何不一致)时,用户无法像调试代码一样定位问题

3) 统一重建与生成:从计算机视觉的分裂到融合 — 07:15 🎧 · ▶️

💬

Fei-Fei Li 从学科历史角度阐述 Atlas 的突破性:计算机视觉领域已分裂超过半个世纪——国际会议有独立的"像素生成 track"、"识别 track"、"3D 重建 track",数不清的博士论文分别攻克这些孤立问题。

Atlas 首次在 单一模型 中统一:

  • 像素重建(Reconstruction):传统计算机视觉的核心,需要精确几何、多视图几何(Multi-View Geometry)
  • 像素生成(Generation):扩散模型的强项,擅长创意内容但缺乏几何一致性

实现方式:

  • 原生多模态设计:从预训练阶段就支持文本、图像、视频、相机姿态深度图(depth maps) 作为原生输入
  • 3D 作为原生模态:每一帧关联的虚拟相机位置和参数是模型的 native input,深度图告诉模型该位置的空间结构

Justin 强调这需要架构根本性改变:传统重建模型(如 NeRF)输出是专门的 3D 表示(如 Gaussian Splat),传统生成模型输出是 RGB 像素,两者的 loss function、训练数据、评估指标完全不同。

💡

这是 任务边界的消解。类比:早期 NLP 有独立的词性标注模型、句法分析模型、机器翻译模型,现在 Transformer 一统天下。Atlas 对计算机视觉的意义类似——不再需要针对重建和生成维护两套技术栈。

对空间智能的意义:Fei-Fei 指出,要实现空间智能(理解几何、物理、规划行动),生成锚定在视角估计上的像素 是从"海量像素生成模型"到"真正理解空间"的关键一步。没有几何约束的像素生成只是"漂亮的幻觉"。

  • 统一 = 妥协?:历史上很多"大一统"模型最终在专项任务上输给专精模型(如早期多任务学习的失败)。Atlas 在纯重建任务上能否匹敌 NeRF 后继者?在纯生成任务上能否匹敌 Sora?
  • 评估困境:如何评价"既准确又有创造力"?重建任务用 PSNR/LPIPS,生成任务用人类偏好,统一模型的评估基准是什么?

4) Sparse 重建突破:从 300 张照片到 3 张照片 — 13:12 🎧 · ▶️

💬

Ben(NeRF 发明人)详解 Dense vs. Sparse 重建 的核心矛盾:

Dense 重建的残酷现实:

  • 每个想要出现的物体需要 3-4 个视角 覆盖
  • 一个房间(麦克风下方、桌子底下、椅子腿之间、植物叶片缝隙)要真正"密集"覆盖,需要 200-300 张照片
  • 训练有素的专业人士需要数分钟,普通消费者首次尝试多房间扫描可能耗时 2 小时

Sparse 重建的革命性:

  • Atlas 目标:50-100 倍数据削减,从数百张降到 3 张
  • 关键案例:斯坦福 Quad 演示——所有输入照片都是 Ben 站在地面拍摄,但重建出的场景可以从空中视角观看(那些视角的像素 100% 是生成的,但符合重建的几何约束)

技术桥梁——生成与重建的必然联姻: Justin 解释为何必须融合:

  • 传统重建:需要三角测量(triangulation)每个 3D 点,要求同一点在多视角可见
  • 几何空洞问题:任何未被输入视角捕捉的像素,在传统重建中都是 hole(空洞)
  • 填补空洞 = 生成任务:"基于看到的内容想象看不到的部分"

即使世界专家 Ben 用专业相机拍摄数百张,仍会漏掉某些角落(麦克风下、所有桌腿间)。生成能力是弥补物理采样局限的唯一途径

上下文窗口的类比: Ben 将 Sparse 重建类比 LLM 的上下文长度竞赛(从 128K 到 1M tokens):

  • 重建 = 超长上下文的生成:塞入大量图像,模型需要全局一致性
  • Marble 只能处理几张图像,Atlas 可以处理 64 张输入 做全屋飞行穿越
  • 案例:2000 张照片的多房间扫描,用 Atlas 只需 30-40 张即可达到相似效果

💡

数据经济学的根本改变:

  • 存量数据激活:互联网上的随意照片、旧视频片段、消费者的手机相册——以前都"不可重建",现在成为可用资源
  • 采集门槛坍塌:不再需要专业摄影师、昂贵设备、严格流程,普通人的 3 张照片即可
  • 时间维度解锁:Ben 提到"回溯旧采集影像首次实现重建",意味着历史影像资料可以转化为 3D

这与 LLM 让"写作"门槛坍塌类似——Atlas 让"3D 创作"从专业工作流(Maya/Blender 建模几周)变为"拍几张照片"。

  • 质量 vs. 数量的权衡点未知:3 张照片的重建在什么复杂度下会崩溃?是否存在场景类型的 curse(如镜面反射、透明物体)?
  • 生成部分的"准确性"悖论:Ben 说"95% 的照片可以扔掉",但那 95% 包含的信息去哪了?模型是"猜对了"还是"碰巧视觉上可信"?对于需要毫米级精度的工业应用(建筑测量),这种 sparse 方法可行吗?

5) 创意应用:从电影特效到建筑设计 — 20:25 🎧 · ▶️

💬

Ben 描述 Marble 用户的"意外用法"揭示需求:很多人输入图像生成 3D Gaussian Splat 后,只是截几张不同视角的 2D 截图就走了——他们要的不是 3D 模型,而是 多视角一致的 2D 图像。这直接催生了 Atlas 的核心定位。

创意工作流的现状痛点:

  • 多阶段拼接:心情板(mood board)选图 → 多个图像模型生成 → 视频工具做关键帧 → 剪辑工具合成
  • 3D 一致性缺失:用图像模型要求"换个角度看同一房间",每次生成物体都会移位——"看起来不稳定"
  • 状态持久性需求:创作者习惯"舞台+道具"的心智模型(源自几十年的虚拟建模经验),而非"每次生成都抛弃状态、只保留 text prompts"

Atlas 提供的解决方案:

  • 精确的多模态控制:不仅是文本,还有相机姿态、图像位置、对象身份等"旋钮"
  • 维持质量的前提下增加控制:Ben 强调"不能为了控制牺牲质量,否则沦为 party trick"
  • 可编辑性(Editability):多轮迭代中保持世界状态,类似今年单图编辑模型的能力向世界模型迁移

扩展应用场景:

  • 建筑/施工可视化:会展展位设计、建筑方案预览——目前从"口头反馈/草图"到"3D 软件实现"可能耗时一周,95% 时间在手动建模
  • 工业设计迭代:从"创意总监口述"到"3D 修订稿"的循环加速
  • 互联网存量内容挖掘:Ben 提到把自己"以前永远重建不出来的旧采集"成功转为 3D

💡

接口革命 > 能力革命: Ben 的核心论点是"重新设计人与 3D 世界的交互方式"。现有 3D 软件(Maya、Blender、Unity)的交互范式停留在几十年前,学习曲线陡峭(不如"玩乐高、捏陶土、铅笔素描"直观)。Atlas 的多模态控制是让 3D 创作 回归人类自然的空间思维方式

长尾市场的解锁: 不仅是好莱坞特效(已有成熟流程),更是:

  • 小型内容创作者(YouTube、独立游戏)
  • 企业内部可视化(产品演示、培训材料)
  • 电商 3D 展示(从平面图到可交互场景)

  • "旋钮"的诅咒:更多控制 = 更高认知负荷。普通用户是否真的想要"精确相机姿态控制",还是更需要"智能自动化"?
  • 创意主权问题:当 95% 内容是 AI 生成(只有 3 张照片是真实输入),作品的"原创性"如何界定?版权归属如何判定?
  • 质量上限的透明度:Ben 说"维持质量前提下加控制",但当前 Atlas 的生成质量上限在哪?是否已达到 Runway/Pika 等视频模型的水准?

6) 机器人革命:Real-to-Sim 与动态世界模拟 — 28:55 🎧 · ▶️

💬

Fei-Fei Li 揭示 World Labs 收购的机器人公司 Synnex 的核心技术痛点:Real-to-Sim(真实到仿真) 流程目前依赖 Dense 重建。

机器人数据问题的根源:

  • 数据是当前最大瓶颈(未来才是算力)
  • 训练机器人策略(如工业电缆布线)需要大量仿真数据
  • Randomization(随机化)必不可少:不能只训练"电缆弯成这个角度",要泛化到不同尺寸、颜色、位置、障碍物
  • 传统做法:密集重建真实环境 → 在仿真中随机化条件 → 生成训练数据

Synnex 的当前流程瓶颈: 用 Ben 描述的 Dense 方法重建工业场景(如电缆布线工位):

  • 拍摄数百张照片
  • 耗时长、劳动密集
  • 严重拖累迭代速度(每次调整场景需重新采集)

Atlas 的直接价值: 用 Sparse 重建(3-64 张照片)替代 Dense,数量级提速 Real-to-Sim 流程

更深层的技术路线: Justin 阐述机器人策略训练的根本挑战——它与所有其他 AI 应用不同:

  • 非静态 artifact:不是生成"代码/图像/视频"这种可离线评估的产物
  • 环境交互 agent:策略在真实世界执行动作,环境会以不可预测方式响应
  • 必须见过所有失败模式:训练期间需要暴露给"所有可能出错的情况"

仿真的两条路径:

  1. 经典物理引擎:人类设计师显式编码所有场景,精确但覆盖面有限
  2. 神经仿真器(Neural Simulator):数据驱动,从大规模数据学习"世界如何响应动作"

Atlas 的未来角色:

  • 作为神经仿真器:理解物理世界的动态响应
  • 从仿真器到规划器:既能预测"动作 A 会导致结果 B",也能反向推理"要达到 B 需要动作 A"——这是 世界模型的终极形态

💡

解决机器人领域的"数据贫瘠":

  • 不像 LLM 有整个互联网文本,机器人的真实交互数据极度稀缺且昂贵
  • Randomization 需要大量仿真变体,传统方法需要手动建模每个变种
  • Atlas 可以 生成式地扩充场景变体:同一工位的不同光照、物体位置、背景——从几张真实照片衍生出数千种仿真场景

世界模型的"闭环"愿景: Fei-Fei 的表述揭示长期目标:

  1. 理解空间(当前 Atlas)
  2. 模拟动态(下一步)
  3. 规划行动(终极目标)

这与 OpenAI 的 SORA → robotics policy 路线图类似,但 World Labs 从几何一致性(而非纯视觉)切入,可能在物理准确性上更有优势。

  • 神经仿真器的幻觉问题:LLM 会编造不存在的 API,神经仿真器会不会"幻觉"出违反物理定律的动态?机器人执行时如何验证?
  • Sim-to-Real Gap 未解决:即使仿真完美,迁移到真实世界仍是巨大挑战(材质、摩擦、传感器噪声)。Atlas 如何应对?
  • 安全性验证:工业机器人需要安全认证。纯数据驱动的仿真器能否通过监管审查?

7) 未来方向:动态、可编辑性与多模态控制 — 35:24 🎧 · ▶️

💬

动态(Dynamics)的现状与路线: 有人质疑 Atlas"缺乏动态",但 Justin 澄清:

  • Atlas 架构已支持动态:与 Marble(架构层面完全静态)不同,Atlas 从架构到训练数据都已包含时间维度
  • "婴儿级动态"已存在:演示视频中有水波纹、行驶的小车等动态元素
  • 预训练已见大量动态数据,当前发布版本的后训练(post-training)侧重静态 + 空间移动,动态能力被"压制"但未消失

动态与重建的表面矛盾: 主持人困惑:如果场景在动,怎么从多视角重建出一致的 3D?

Justin 的反直觉答案:

  • 暴露给动态数据反而帮助静态重建:让模型学会"分解(factor out)动态成分"
  • 类比:如果只喂完全静态的数据,模型会过拟合静态假设;见过动态后,模型学会区分"哪些是场景固有结构,哪些是瞬时运动"
  • 预训练大量动态 + 后训练侧重静态 = 当前最优策略

可编辑性(Editability)的深层含义: Ben 强调"多模态控制"(multimodal conditioning)被学术界低估:

  • 不仅是"能控制",而是 保持质量的前提下增加控制
  • 单图模型今年已实现强编辑能力(Flux、SD3),视频模型开始跟进(如 30-50 张参考图的 omni-reference),但仍缺乏几何精确性
  • World Labs 目标:工业级质量 + 精确控制(文本、图像、相机、对象身份、布局、时间)

接口革命的愿景:

  • 有状态的 3D 世界:不是"生成-丢弃-再生成",而是"建立场景-持续编辑-保持一致性"
  • 从槽机到工具:告别"反复重试直到运气好"的 prompt 工程,转向"精确表达意图"
  • 重新设计交互范式:让 3D 软件回归"乐高/陶土/素描"的直观性

💡

4D 视频的暗示: 当主持人问"是否会有 4D 视频(时间 + 3D 空间自由漫游)",三人的笑容和停顿传递了明确信号——这在路线图上,且可能不远。这将是 时空解耦的终极形态

  • 时间轴:前进/后退/暂停
  • 空间轴:任意视角观看
  • 结合:《黑客帝国》式的"冻结时间+空间漫游"不再需要数百台摄像机

可编辑性 = 可控性 = 生产力: Ben 的论点击中要害:party trick(炫技演示)vs. 生产工具的分水岭在于"是否不损失质量"。历史上很多"可控生成"模型因质量妥协而无人使用(如早期的 ControlNet 在复杂场景下的崩溃)。

  • 动态的物理准确性:水波纹、车辆移动是"看起来对"还是"物理仿真对"?如果是前者,在机器人/自动驾驶等安全关键应用中不可用
  • 控制的维度爆炸:当有 10 种控制模态(文本、图、pose、depth、时间、对象 ID...),用户如何不被淹没?是否需要"智能默认"或"分层抽象"?
  • 实时性缺失:讨论中未提及推理速度。如果生成一个 10 秒的 4D 视频需要 1 小时,交互式编辑仍是空谈

8) 哲学高度:New View Prediction 的 AI Completeness — 40:28 🎧 · ▶️

💬

Justin 引入 AI Completeness 概念(类比图灵完备性 Turing Completeness):

  • 定义:一个任务如果能将"任意该类别问题"规约(reduce)到它,则称为 AI-complete
  • 经典案例:LLM 的 next token prediction——Ilya Sutskever 的推理小说例子:"凶手是____",要预测下一个 token 需要理解整部小说的逻辑

New View Prediction 的 AI Completeness 论证: Justin 和 Ben 构建了类比:

  • 视觉版推理小说:给定电影的所有帧,最后一个镜头"凶手走出房间"——预测那个人的长相 = 需要理解整部电影的因果
  • 更强的论证:要求生成"Martine 在黑板上写黎曼猜想证明"的场景,从某个视角看清公式——模型必须"懂数学"才能生成正确公式

Fei-Fei Li 的进化视角: 她提出惊人的生物学类比:

  • 自然为什么给动物眼睛,却不给树眼睛?
  • 答案:因为动物会移动
  • 移动 = 持续遇到新视角 = 必须解决 new view prediction 才能生存
  • 进化压力使新视角预测成为智能的核心

结论:New View Prediction 是 Token Prediction 的等价物——一个通向通用智能的底层原语。

💡

重新定义"什么是世界模型": 此前业界对"世界模型"的定义混乱:

  • 悲观派:只是视频生成的营销话术
  • 乐观派:任何能预测下一帧的模型都是世界模型

Fei-Fei 团队给出了更严格的定义:世界模型 = 能够基于几何一致性进行新视角预测的模型。这排除了纯像素插值的视频模型,也排除了无法泛化视角的 NeRF。

通用智能的路径之争:

  • 语言派(OpenAI/Anthropic):通过 token prediction 逼近智能
  • 视觉派(DeepMind 的 Gato/Gemini):多模态统一
  • 空间派(World Labs):通过空间推理(new view prediction)逼近智能

Fei-Fei 的进化论证暗示:语言可能是智能的晚期产物,空间推理才是基础——动物在拥有语言前亿万年就在解决空间导航问题。

  • AI Completeness 的严格性存疑

    • 黎曼猜想的例子:模型可以"生成看起来像数学公式的符号"而不真正理解,就像 LLM 能生成"看起来像代码"的文本但逻辑错误
    • 图灵完备性是形式化证明,AI completeness 更像哲学论证
  • 进化类比的过度延伸

    • 树没眼睛也可能是能量经济学原因(光合作用 > 视觉的投资回报率)
    • 章鱼有复杂视觉和空间智能,但认知结构与哺乳动物根本不同——"移动 → 视觉 → 智能"的因果链可能过于简化
  • 与语言智能的协同未探讨

    • 人类智能的独特性恰恰在语言 + 空间的结合
    • Atlas 当前的文本理解能力如何?能否理解"在马克杯左边生成一只猫"这种需要空间语义理解的指令?

人物与机构

人物:

  • Fei-Fei Li(李飞飞):World Labs 创始人,前斯坦福 AI Lab 负责人,ImageNet 创建者
  • Justin:World Labs 模型负责人,主导 Atlas 架构设计与训练
  • Ben Mildenhall:NeRF(Neural Radiance Fields)发明人,3D 重建专家
  • Ilya Sutskever:OpenAI 联合创始人(Justin 引用其"推理小说"思想实验)

机构:

  • World Labs:成立 2.5 年,前作 Marble(输出 Gaussian Splats),现发布 Atlas
  • Synnex:被 World Labs 收购的机器人公司,专注 Real-to-Sim 技术
  • a16z(Andreessen Horowitz):本播客主办方,知名 VC

技术谱系:

  • NeRF(2020)Gaussian Splatting(2023)Marble(2024)Atlas(2026)
  • 关键演进:从静态显式 3D 表示 → 动态隐式表示 + 生成能力

数字与证据

指标数值上下文
数据效率提升50-100×从密集重建的 200-300 张照片降到 3 张
Marble 输入上限几张图像架构瓶颈限制
Atlas 输入上限64+ 张图像已验证的上下文窗口
Bullet Time 最少相机数3 台对比《黑客帝国》的数百台
多房间Dense采集耗时2 小时(新手)/ 数分钟(专家)传统流程
Atlas 稀疏采集30-40 张替代 2000 张Ben 的真实案例
Stanford Quad 演示3-25 张地面照片重建出空中视角(100% 生成)
Scaling 阶段"基本在起点"Justin 表示受限于算力非数据
预训练周期首次成功"第一轮预训练就达到发布质量是疯狂的"
公司成立时长2.5 年从 Marble 到 Atlas

关键时间点:

  • 2026 年初夏某天:Ben 用中等规模 Atlas 模型生成"飞过桌下看到足球"的演示,团队 5 秒内决定全力投入
  • 2026-09-03:Atlas 正式发布
  • 2026-09-04:本播客录制

金句

"LLMs are built on next token prediction. Atlas is really new view prediction."
—— Justin | 定义 Atlas 的基础原语

"On the path to spatial intelligence, generating pixels that are truly spatially contextualized and grounded, that is the very hard step that Atlas has taken."
—— Fei-Fei Li | 从像素生成到空间智能的关键跃迁

"There's hundreds of cameras doing that angle on a green screen. With Atlas, we can do this with just three cameras."
—— Justin | 《黑客帝国》Bullet Time 的民主化

"No one has ever seen these results."
—— Fei-Fei Li | 描述桌下足球演示的历史性时刻

"Reconstruction is just like generation with a really long context."
—— Ben Mildenhall | 统一重建与生成的核心洞见

"Why does nature give animals eyes but not trees? Because when you move, you see a new viewpoint."
—— Fei-Fei Li | 从进化论证 new view prediction 的根本性

"New view prediction is AI complete. You could have a world where Martine is writing a proof of the Riemann hypothesis on the board."
—— Justin | AI Completeness 的论证

"We're basically at the beginning. We're basically limited by compute at this point."
—— Justin | Scaling Law 仍在早期阶段

"People don't think in this ephemeral 'generate-throw away-keep my text prompts.' People want to build this collection of assets and model a world."
—— Ben Mildenhall | 有状态 vs. 无状态创作范式

"If you could instantly know the right thing that's going to scale, you should just do that. But when we started the company, there's no scaling law of spatial intelligence."
—— Justin | 探索的必要性


洞见与延伸背景

1. 从"Token 智能"到"视角智能"的范式竞争

当前 AI 有三条通向 AGI 的路径在竞争:

  • 语言路径(OpenAI/Anthropic):通过海量文本的 token prediction 逼近推理能力
  • 多模态路径(Google DeepMind):统一文本/图像/视频/音频
  • 空间路径(World Labs):通过几何一致的视角预测理解物理世界

Fei-Fei 的进化论证暗示:语言是晚期产物,空间推理才是智能基础。这挑战了当前主流(LLM 中心论),也解释了为何 embodied AI(具身智能)难以从纯语言模型迁移——它们缺乏最底层的空间先验。

2. 3D 内容创作的"iPhone 时刻"

当前 3D 内容产业的矛盾:

  • 需求爆炸:游戏、元宇宙、电商、建筑可视化、工业设计
  • 供给瓶颈:专业 3D 艺术家稀缺且昂贵,工具(Maya/Blender)学习曲线陡峭

历史类比:

  • 摄影:从大画幅相机(专业摄影师)→ 傻瓜相机 → 智能手机(人人都是摄影师)
  • 视频剪辑:从 Avid(专业剪辑师)→ iMovie → TikTok(零门槛)
  • 3D 创作:当前仍在"大画幅相机"阶段,Atlas 可能是迈向"傻瓜相机"的关键

3. Sparse 重建的经济学含义

100 倍数据效率不只是技术指标,而是边际成本坍塌

  • 存量激活:互联网上数十亿张"不可用"照片变为可用(Flickr、Instagram、Google Photos)
  • 时间旅行:历史影像首次可转 3D(如 1960 年代的城市街景)
  • 众包可能:普通人的手机照片可以贡献到"世界的数字孪生"

类比:Google Earth 早期靠卫星图像(昂贵),后期靠用户上传照片(免费)。Atlas 可能开启"世界 3D 化"的众包时代。

4. 机器人数据飞轮的启动条件

当前机器人困境:

  • 真实数据稀缺 → 泛化能力差 → 部署失败 → 更少真实数据(恶性循环)

Atlas 提供的突破:

  1. 低成本 Real-to-Sim:从真实场景快速生成仿真环境
  2. 场景随机化:从几张照片衍生数千种变体
  3. 神经仿真器:学习物理动态,替代手动建模

如果成功,将启动飞轮:

  • 更多仿真数据 → 更好策略 → 更多成功部署 → 更多真实数据反馈 → 更准确仿真器

5. "AI Complete"概念的深层含义

AI Completeness 不只是哲学论证,而是 评估研究方向天花板 的工具:

  • 图像分类:不是 AI-complete(ResNet 接近人类但未解锁通用智能)
  • Next Token Prediction:被广泛认为 AI-complete(GPT-4 展现出涌现能力)
  • New View Prediction:World Labs 主张同样 AI-complete

如果成立,意味着 空间智能的天花板 = 通用智能,值得与语言智能同等的资源投入。

6. 从"工具"到"介质"的跨越

Ben 提到的"重新设计交互范式"指向更深层转变:

  • 工具时代:Photoshop、Maya——用户通过复杂操作表达意图
  • 介质时代:纸笔、陶土——意图表达接近思考速度

Atlas 的多模态控制若成功,3D 创作可能从"工具"变为"介质"——思考即创作,类似素描艺术家的手眼协调。


争议与需核实

1. Scaling Law 的证据不足

  • 声称:"每次扩大模型和训练时长都显著改善"
  • 缺失:具体的 scaling curve(如 Chinchilla 论文的详细数据)、消融实验、不同规模的定量对比
  • 风险:可能遭遇 plateau(如 GPT-4 后的收益递减争议)

2. 物理准确性的模糊性

  • 声称:可用于机器人仿真
  • 疑问:演示的水波纹、车辆运动是"视觉可信"还是"物理仿真精确"?
  • 关键缺失:与物理引擎(Mujoco、Isaac Sim)的定量对比、碰撞检测准确率、力学守恒验证

3. "首次统一"的历史准确性

  • 声称:首次统一重建与生成
  • 可能的先驱
    • NVIDIA 的 Instant NGP(2022)已结合 NeRF + 快速训练
    • Google 的 DreamFusion(2022)结合扩散模型 + NeRF
    • "首次"可能指"首次在生产级模型"而非学术首创

4. Sparse 重建的鲁棒性边界

  • 演示偏差:所有 demo 都是精心挑选的成功案例(篮球、草莓、Stanford Quad)
  • 未展示:失败模式、边界情况(强遮挡、镜面反射、透明物体、动态模糊)
  • 关键问题:3 张照片在什么场景复杂度下会崩溃?

5. AI Completeness 论证的严格性

  • 类比的局限:LLM 的"推理小说"例子已被质疑(模型可能记住训练集中的情节而非真正推理)
  • New View Prediction 同样存疑:生成"黎曼猜想证明"可能只是拼接训练过的数学符号,不代表理解
  • 需要形式化证明:如图灵完备性的数学证明,而非直觉论证

6. 与现有视频模型的质量对比缺失

  • 未提及竞品:Runway、Pika、Sora、Kling——它们的视觉质量当前如何对比?
  • 控制 vs. 质量的权衡:Ben 强调"不牺牲质量",但未给出客观评估(LPIPS、FVD、人类偏好测试)

7. 计算成本的透明度缺失

  • 训练成本:Atlas 的预训练用了多少 GPU-hours?数据集规模?
  • 推理成本:生成一个 10 秒视频需要多久?是否实时?
  • 商业可行性:如果成本高昂,应用场景会被限制在高端市场

行动建议

对技术从业者:

  1. 跟进空间智能赛道:如果 New View Prediction 真的 AI-complete,这是与 LLM 同级的基础研究方向
  2. 关注 3D 数据集构建:Sparse 重建降低了数据采集成本,可能出现"3D 版 ImageNet"的机会
  3. 探索垂直应用:电商 3D 展示、建筑可视化、教育培训——寻找"Atlas 原生"的产品形态

对创意工作者:

  1. 实验 World Labs 产品:如果有 Beta 访问权限,测试边界(什么场景有效、什么失败)
  2. 重新设计工作流:从"完全手动建模"转向"照片 + AI 精修"的混合模式
  3. 保护创意主权:明确哪些部分是你的原创输入(IP 归属的未来战场)

对投资者:

  1. 评估基础设施机会:3D 数据存储、标注工具、模型托管(类比 Hugging Face 对 LLM 的角色)
  2. 寻找应用层创业:在 Atlas API 之上构建垂直 SaaS(如"会展设计助手"、"电商 3D 转换器")
  3. 关注监管风险:Deepfake、版权、隐私(从照片逆向重建私人空间)

对研究者:

  1. 复现与扩展:Atlas 论文若发布,关键消融实验、Scaling Law 验证
  2. 对抗性测试:设计"杀手测试集"——强遮挡、镜面、透明度、极端动态
  3. 理论工作:形式化"New View Prediction 的 AI Completeness"(类比 Turing 完备性的数学证明)

对政策制定者:

  1. Deepfake 2.0 防范:3D 重建 + 任意视角生成 = 更难检测的虚假证据
  2. 隐私保护:从公开照片重建私人空间的边界(如从街景推断室内布局)
  3. 关键基础设施保护:禁止敏感设施(军事基地、核电站)的 3D 重建数据公开

来源

  • 音频音频
  • YouTubeYouTube
  • Episode 页面a16z.simplecast.com
  • 转写来源:YouTube Auto-Generated Captions
  • 时长:2623 秒(43 分 43 秒)
  • 发布日期:2026-09-04
  • 制作方:a16z(Andreessen Horowitz)

相关资源:

  • World Labs 官网:worldlabs.ai
  • Atlas 发布博客:[需查证具体 URL]
  • NeRF 原始论文:Mildenhall et al., "NeRF: Representing Scenes as Neural Radiance Fields for View Synthesis" (ECCV 2020)
  • Gaussian Splatting 论文:Kerbl et al., "3D Gaussian Splatting for Real-Time Radiance Field Rendering" (SIGGRAPH 2023)

深度笔记版本:v1.0
整理时间:基于 2026-09-04 播客录音
覆盖时间戳:00:00 - 43:26(完整覆盖)
核心方法论:基于原始转写的实质内容提取 + 跨领域洞见关联 + 批判性争议标注