a16z GP Jennifer Li 对话 fal 联合创始人 Gorkem 与工程负责人 Batuhan:当生成视频快到实时,游戏从「更好看的抽卡」变成可导播的连续流。H3 Max 通过对 MiniMax 开源权重帖训+系统/硬件优化,把时延压到可直播(乃至 Turbo 约 1.5s 出 5s 片);Director 模式用约 2 分钟细粒度记忆+长程提示,支持中途改指令仍保持人物场景。下一战场不是更快,而是运镜/灯光/角色/唇形的可控性逼近制片厂要的 99.9% 可靠;Blender 参考渲染+模型已成为专业工作流,好莱坞是增长最快客户群。
- 实时是产品形态开关:使连续导播与中途改指令成为可能。
- H3 Max = 开源权重帖训 + 系统/硬件优化,而不只是换基座。
- 场景记忆(~2 分钟细记 + 长程提示)是 Director/连续流的技术底座。
播出信息
- 节目: The a16z Show
- 嘉宾: Gorkem Yurtseven(fal 联合创始人)、Batuhan Taskaya(fal 工程负责人)
- 主持: Jennifer Li(a16z GP)
- 发布: 2026-09-17(RSS pubDate 日)
- 时长: 00:39:32(约 2372 秒)
- 单集页: https://a16z.simplecast.com/episodes/the-next-frontier-of-ai-video-is-control-RmfmPBwf
- YouTube: https://www.youtube.com/watch?v=SDbRJXQrYGY
- 音频: https://mgln.ai/e/1344/afp-848985-injected.calisto.simplecastaudio.com/3f86df7b-51c6-4101-88a2-550dba782de8/episodes/3cafbcc2-e9d6-40ae-adcb-adee4b50432e/audio/128/default.mp3?aid=rss_feed&awCollectionId=3f86df7b-51c6-4101-88a2-550dba782de8&awEpisodeId=3cafbcc2-e9d6-40ae-adcb-adee4b50432e&feed=JGE3yC0V
- 英文转写来源: YouTube auto captions(未找到更优公开全文稿)
来源
节目结构
- 开场:实时生成视频改变了什么 — 00:00 🎧 · ▶️
- fal 与 H3 Max:从推理平台到帖训模型 — 00:47 🎧 · ▶️
- 为何押注帖训练:速度×质量的交汇 — 02:45 🎧 · ▶️
- 系统工程秘方:架构、硬件与成本延迟 — 06:33 🎧 · ▶️
- Twitch 时刻:上线次日就实时直播 — 10:44 🎧 · ▶️
- 场景记忆:模型如何「记得」刚才发生了什么 — 13:11 🎧 · ▶️
- 经济账:服务成本、芯片与流式体验 — 15:47 🎧 · ▶️
- 超越消费者:好莱坞级可控性 — 22:02 🎧 · ▶️
- 当导演用提示词:运镜、灯光与场理解 — 28:37 🎧 · ▶️
- 下一步与创作者经济:从生成到可控生产 — 35:43 🎧 · ▶️
分节详解
1) 开场:实时生成视频改变了什么
💬 他们说了什么: Jennifer Li 引出主题:生成视频一旦快到实时,创作者工作流会发生什么质变。嘉宾是 fal 联合创始人 Gorkem Yurtseven 与工程负责人 Batuhan Taskaya。开场点出本期核心张力——速度已破局,下一战场是控制。
💡 为什么重要: 把整集框架钉在「实时」阈值上:不是又一个更好看的 demo,而是交互式、可导播的生产工具门槛。
⚡ 争议点: 「实时」是否已足够普适,还是仍限于短片段/特定硬件?
2) fal 与 H3 Max:从推理平台到帖训模型
💬 介绍 fal:原本是推理/生成媒体平台;H3 Max 是他们对 MiniMax 开源权重视频模型做帖训练后的版本。发布后迅速成为平台上最受欢迎的视频模型之一。团队把模型帖训与系统/硬件优化叠在一起,显著压低生成时延同时保住质量。
💡 展示「平台公司」如何向上游延伸到帖训:不是只卖 GPU 分钟,而是用端到端优化定义体验。
⚡ 帖训开源权重的护城河有多深?上游模型迭代是否随时抹平差异?
3) 为何押注帖训练:速度×质量的交汇
💬 为何从纯推理平台走到帖训?因为只做托管,难同时打穿延迟与画质。H3 Max / Turbo:约 1.5 秒出 5 秒视频、质量仍在高分位。速度使「边生成边改」成为可能,而不只是离线批跑。
💡 帖训+系统优化是 fal 的差异化赌注;实时是产品形态开关,不是营销形容词。
⚡ 过度优化延迟是否牺牲长镜头一致性与物理可信度?
4) 系统工程秘方:架构、硬件与成本延迟
💬 Batuhan 拆解逐组件优化:管线、硬件选型、架构改动共同把成本/延迟曲线压下去。视频模型服务链路比文本复杂得多,fal 的策略是跨硬件把整条管线打薄。
💡 提醒听众:视频「可用」往往是系统工程胜利,不只是换更大基座模型。
⚡ 这类优化是否可复现于其他开源视频模型,还是高度绑定 H3/特定栈?
5) Twitch 时刻:上线次日就实时直播
💬 上线次日就有人在 Twitch 把模型当实时工具直播;内部也被速度吓到,先做验证再公开发布。速度解锁了自发项目与连续视频实验。
💡 产品市场契合的信号来自「有人立刻拿去直播」,而非只看榜单分数。
⚡ 病毒式直播是否可持续转化为付费工作流,还是一阵新奇?
6) 场景记忆:模型如何「记得」刚才发生了什么
💬 讲解场景记忆:从记住上一段 5 秒,扩展到约 2 分钟细粒度记忆;更长则用演进式系统提示保持叙事/世界观,连贯可至约 60 分钟。H3 Max Director:连续可交互流,可中途语音/文本插入新指令并保持人物与场景。
💡 「记忆」把生成从剪贴片段升级为可导播的时间线——这是控制问题的技术底座。
⚡ 2 分钟细记 + 长程提示是否在复杂多角色场景下崩坏?幻觉与身份漂移如何度量?
7) 经济账:服务成本、芯片与流式体验
💬 讨论服务成本、芯片占用与流式体验的经济性。实时流对算力密度与调度要求更高;需要把成本压到创作者/工作室愿意持续开着的水平。
💡 没有单位经济,实时只是演示;有单位经济,才能变成默认创作环境。
⚡ 芯片供给与价格波动下,实时视频的毛利能否撑住消费级定价?
8) 超越消费者:好莱坞级可控性
💬 下一挑战从速度转向可控性:运镜、灯光、角色、动作、唇形同步,目标是接近工作室要的 99.9% 可靠而非 80–90%「差不多」。好莱坞等专业客户是增长最快的一段;法律与数据驻留障碍已打通,可用自有 IP。专业工作流常见:Blender 参考渲染 + H3 Max,接近「全控制」。
💡 市场叙事从「消费者玩梗」切到「制片厂生产工具」——采购标准完全不同。
⚡ 99.9% 是否可实现?版权/表演权/工会约束是否比技术更硬?
9) 当导演用提示词:运镜、灯光与场理解
💬 用自然语言「当导演」:指定机位、运动、场理解;模型需理解空间关系才能执行。控制面从单次提示词变成持续导播指令流。
💡 交互范式变了:创作者从「抽卡」转向「执导」——技能曲线与产品 UI 都要重写。
⚡ 语言控制精度是否足以替代传统时间线/关键帧工具,还是永远互补?
10) 下一步与创作者经济:从生成到可控生产
💬 展望下一阶段与创作者经济:速度已够用后,胜负手是可控生产与工作流嵌入。生成媒体大会观众结构已明显专业化。预测工作室 AI 用量可能数量级上升。
💡 收束论点——控制 > 单纯更快跑分;平台要服务职业创作者的可预测性。
⚡ 创作者经济是扩容还是替代人力?本期偏工具赋能叙事,分配效应着墨较少。
金句
The next frontier of AI video is control — not just going faster.
Real-time turns generation from a lottery into something you can direct.
Studios do not want 80–90% “pretty good”; they want something closer to 99.9% reliable.
来源(再列)
- Episode: https://a16z.simplecast.com/episodes/the-next-frontier-of-ai-video-is-control-RmfmPBwf
- YouTube: https://www.youtube.com/watch?v=SDbRJXQrYGY
- Local EN transcript:
/workspace/podcasts/a16z/transcripts/ai_video_control.en.md