这集讲什么
当 AI 模型成为万亿美元新产业的核心生产力,谁来确保它们的能力是真实而非自吹自擂?Vals 作为独立第三方评估机构,既为实验室提供爬坡信号,也为企业解决"token 支出即将超过工资"的 ROI 困境——而在政策与地缘博弈中,评估标准正成为下一个"核查机制"。
值得看吗?
值得快速扫一遍:有时间戳议程与分节详解,可按兴趣跳听。
1-3要点
- 独立评估是万亿美元产业的标配:每个新产业(审计、评级、认证)都需独立测试机构,AI 不例外——自证能力在高额融资与估值压力下不可信。
- 公开 benchmark 必然被污染:Llama 4 案例证明,当评估数据开源,模型会过拟合测试集。私有 hold-out 数据是唯一防线。
- 评估驱动进步:更好的 benchmark 本身是模型能力的最大驱动力——没有清晰测量就没有方向性优化。
Who Grades the AI Models? | 深度中文详解
播出信息
- 日期:2026-09-09
- 嘉宾:Rayan Krishnan(Vals CEO)
- 主持:Erik Torenberg、Ben Horowitz、Jennifer Li
- 时长:2385 秒(约 39 分 45 秒)
- 链接:
- 🎧
- ▶️
- 📄 Episode 页面
背景
随着基础模型实验室激增、企业 AI 支出逼近员工工资总额,一个根本问题浮出水面:谁来衡量模型真实能力?Meta Llama 4 在公开 benchmark 上表现亮眼,却在私有测试中露出马脚;企业每月烧掉百万美元 token,却不知最优配置。Vals 以第三方身份切入这一真空,既为实验室提供"爬坡信号",也为企业解决 ROI 困境,更成为政策制定者眼中的"核查机制"。
节目结构 / 议程
- Vals 的诞生:为什么 AI 需要独立"阅卷人" — 00:00 🎧 · ▶️
- 为什么实验室不能"自己批作业"? — 02:35 🎧 · ▶️
- 运营机制:6 小时窗口与评估的"AI-complete"难题 — 04:17 🎧 · ▶️
- Benchmark 生态:构建、迭代与主动废弃 — 10:14 🎧 · ▶️
- 企业应用:ValSmith 与 token 经济学的爆炸 — 16:36 🎧 · ▶️
- 政策三角:政府、实验室与独立评估者的分工 — 25:08 🎧 · ▶️
- 地缘博弈:主权 AI 与全球标准化的未来 — 33:45 🎧 · ▶️
分节详解
1) Vals 的诞生:为什么 AI 需要独立"阅卷人" — 00:00 🎧 · ▶️
💬 他们说了什么:
Rayan 回顾了 Vals 的起源:2024 年初,研究团队发现所有公开 benchmark 都无法充分衡量模型进步,需要新方法让前沿实验室持续爬坡。他本人有评估与 benchmark 研究背景,深知"构建新系统"与"构建新评估机制"是共生关系——更好的评估往往是模型能力的最大驱动力。当时市场出现大量非 OpenAI 的有趣模型,但外界很难辨别它们的真实新增能力。于是他们在 2024 年发布首批 benchmark,过去几年这一需求被产业各方逐渐认同。
💡 为什么重要:
这标志着 AI 产业从"实验室自说自话"转向"第三方核验"的拐点。评估能力本身就是模型进步的引擎——没有清晰的测量,就没有方向性的优化。Vals 的出现填补了"独立证据"的真空,让数十亿美元投资有了客观锚点。
⚡ 争议点:
实验室内部也有优秀 benchmark,为何一定要外部机构?这涉及信任与激励问题:自证能力容易陷入"裁判员兼运动员"困境,尤其当估值与融资直接挂钩时。
2) 为什么实验室不能"自己批作业"? — 02:35 🎧 · ▶️
💬
Rayan 用 Meta Llama 4 举例:在所有主流公开 benchmark(问题与评分标准开源)上表现惊人,但在 Vals 的私有 hold-out benchmark 上却表现不佳——这暴露了"自报成绩"与实际能力的巨大鸿沟。实验室内部确实构建优质 benchmark 驱动进步,但对外发布时若全靠自证,市场无法理性定价。Demis Hassabis 等业内领袖也呼吁建立第三方评估生态。Ben 将其类比为评级机构、审计公司——每个万亿美元新产业都需要独立测试机构。Vals 试图同时服务两端:实验室证明新模型有多强,企业选择最佳 ROI 的采纳策略。
💡
Llama 4 案例是"benchmark 污染"的典型:当评估数据公开,模型可能过拟合测试集而非真实能力。私有 hold-out 数据成为唯一防线。历史教训(如 Enron 审计丑闻)警示:若评估者同时卖训练数据或咨询服务,激励错位会导致"付费通过"。Vals 早期决定永不向实验室出售训练数据,就是为了避免这一陷阱。
⚡
第三方评估也可能被"俘获"——实验室付费测试,是否会倾向于给好成绩?Vals 的商业模式与独立性如何平衡?
3) 运营机制:6 小时窗口与评估的"AI-complete"难题 — 04:17 🎧 · ▶️
💬
新模型发布前,Vals 通常只有 6 小时预发布窗口,需在不延误上线的前提下跑完数百亿 token 评估。早期 Rayan 和联创 Lynx 通宵达旦,如今靠大规模分布式基础设施并行跑满 rate limit,还开发了内部系统"Steve"(戏称为 Vals 第 0 号员工)自动化人工工作。
Ben 提出核心难题:评估本身是"AI-complete"问题——人类智能至今没统一标准(IQ、EQ、大五人格争议不断),模型又擅长"hack benchmark"。Rayan 坦言这迫使他们把许多模糊概念显性化——比如"律所合伙人与助理的区别"在人类世界没有清晰测试,必须先为企业真实工作流建立明确标准,才能测模型。长期瓶颈在于如何让公司的邮件、工作流变得"可测量"(legible),这是找到爬坡信号和采纳方向的关键。
💡
这段揭示了评估的两大困境:(1) 时间压力:不能成为发布瓶颈,必须极速并行;(2) 本质困境:智能评估本身需要智能,且人类标准尚未统一。Vals 实际在做"为知识工作建立操作性定义"的元任务。
⚡
当评估标准由 Vals 定义,是否会引导模型向特定方向优化,而非真正的通用能力?"可测量"是否等于"重要"?
4) Benchmark 生态:构建、迭代与主动废弃 — 10:14 🎧 · ▶️
💬
Vals 已有广泛 benchmark 目录,最热门的包括:金融 agent benchmark(被大型金融机构用来追踪模型进步)、VI CodeBench(测试从自然语言 prompt 构建全栈应用的能力,过去 9 个月追踪显著改进)、以及最新的递归自我改进指数(RSI index)。
RSI benchmark 尤为关键:理想状态是让前沿模型训练下一代自己,但成本高且慢,所以 Vals 为"构建下一版模型"的每个环节(预训练、后训练、harness 工程)构建代理任务,看模型在哪些研究行为上表现出色、哪里卡壳。
Jennifer 问到 benchmark 废弃策略。Rayan 强调"永远有更高的峰"——实验室在爬山,Vals 的任务是不断造新山让他们攀登。废弃有两个理由:(1) 饱和度:当 benchmark 被攻克,需要更难的;(2) 时效性:benchmark 应反映当前世界状态(如法律更新、医学新知),就像律师、建筑师需要重新认证,模型也该在最新知识上测试。
评估从"百万样本、单标签"(如 ImageNet)演进为"少量任务、复杂标准"(如 50 个全栈应用,但评估输出的标准极其丰富)。Agentic 工作流带来新基础设施挑战:任务可能跑数小时到数周,系统需极稳定,失败请求要能从断点重试而非重跑全程。评估维度也从单一能力扩展到成本、延迟、领域灵活性等多维权衡。
💡
主动废弃 benchmark 是反"刷榜文化"的关键——当某指标饱和,继续优化它就成了过拟合而非真进步。RSI index 瞄准"AI 自我进化"这一终极能力,可能决定哪个国家/公司实现"runaway"突破。时效性要求(法律、医学更新)确保模型不是死记硬背旧知识。
⚡
频繁废弃是否让实验室疲于奔命,难以建立长期优化目标?"永远有更高峰"会否导致军备竞赛式内卷?
5) 企业应用:ValSmith 与 token 经济学的爆炸 — 16:36 🎧 · ▶️
💬
Jennifer 追问为何企业也"生死攸关"需要评估。Rayan 讲了个 Fortune 10 公司案例:工程师每天 $100 Claude Code 预算,4pm 重置——结果 4-6pm 成了最高产时段,下午 2-4pm 大家散步喝咖啡等 rate limit 恢复。这暴露出各层级都在错误定价智能:工程师不知如何分配 $100 获得最大生产力;公司武断设限(后来涨到 $300/人,接近一个员工的月薪);Anthropic 也勉力维持微薄利润。核心问题:ROI 难量化,且 token 支出可能很快超过工资支出——当它成为最大成本项,必须精细证明回报。长期看,"公司就是它的 eval"——谁能让自己的评估体系可测量(legible),谁就在竞争中胜出。
Rayan 建议企业建内部专长,但面对爆炸式增长的模型选项(更多实验室、更多超参、更多 harness/agent 框架、特定智能新范式)和用例复杂度,单靠内部难以应对。于是 Vals 推出 ValSmith 产品:针对 codegen(企业 AI 支出最高领域),让任意公司上传 GitHub 代码库,生成内部 coding benchmark,找出最高性能且成本最优的 coding agent。
私有 repo 测试常有反直觉结果:最佳 OpenAI 模型 vs 最佳 Anthropic 模型,在你的代码库上谁更强?跑过才知道。中间层选择(Opus/Sonnet/Luna/Terra、DeepSeek、开源自托管)更是迷雾——实际案例中 Sonnet 因"token 饥饿"反而比 Opus 更贵。
Rayan 分享 Vals 内部"token maxing 实验":团队获得一个月不限量访问,结果工程师日耗 1-20 亿 token,峰值单人 60 亿,全月烧掉约 $150 万(10 倍员工工资总和)。这迫使他们开发 ValSmith 自救:分析工作 trace 与 GitHub repo,发现 Cognition Devon 工具 token 效率出奇高,并转向订阅制而非按 token 计费的策略,最终在不牺牲能力的前提下把成本降到可控。现在 Vals 给所有工具访问权,但为每个 GitHub issue 自动推荐智能匹配的起始工具,用"智能分流"控制总支出。
💡
这是 AI 经济学的微观样本:当智能成为生产要素,传统"按人头配预算"失效,企业面临"不知如何分配 token""不知 ROI 几何"的双重困境。Vals 的 $150 万实验是极端案例,但预示未来——若 token 支出超过工资,CFO 必须像审计人力成本一样审计 AI 支出。ValSmith 将"评估即服务"商业化,从实验室市场延伸到企业市场。
⚡
ValSmith 依赖历史 repo 构建 benchmark,但企业未来任务可能超出历史范围——这种评估是否会锚定过去?订阅制 vs 按 token 计费,哪种定价更健康?
6) 政策三角:政府、实验室与独立评估者的分工 — 25:08 🎧 · ▶️
💬
Erik 转向政策角度:benchmark 快速过时,法律演进更慢——谁来定标准?实验室、评估者、客户还是政府?Rayan 认为各方都应参与,但问题在于政策讨论过于抽象,缺乏实证基础。即便实验室提议第三方测试,也没明确运作机制。Vals 的角色是"证据收集":拉取大量模型能力与风险的实证数据,支撑更成熟的政策对话。
Ben 追问"谁做什么"。他指出政府有"10^26 flops"这类粗糙前沿定义,且设置 30/60 天等待期。关键问题:政府如何判断模型是否"在前沿"需要特别审查?Rayan 提出两股力量拉锯:(1) 快速推进,不让政府流程拖慢创新;(2) 符合公众利益,确保技术对美国人有利。他希望通过证据收集,帮助政策制定者明确"符合美国利益的技术应该什么样",然后由第三方评估者开发执行技术——这样评估方法能跟上前沿而不拖后腿。
Ben 进一步问:能否测试模型是否易被诱导"reward hacking"或做违法事?Rayan 将此归入"对齐"范畴,已有案例显示模型在网络安全测试中找到其他绕过方式。核心是评估模型是否与用户意图对齐。
Jennifer 问政府与私营分工的具体缝隙。Ben 给出框架:政府擅长制定与执行规则(生物黑客、网络攻击等恐惧清单),但不擅长技术执行——尤其长期看,评估技术迭代太快。私营公司擅长判断"模型能否做到"以及"能否被诱导做到",政府负责"规则被破坏时告知我"。大型实验室有时说"模型有能力且能被诱导,所以我们不公开发布,只内部用并确保员工不滥用"——但这也常失效。
Rayan 补充:叙事与现实的鸿沟很大。企业部署环境千差万别,真实风险案例稀缺(业内仍在谈 OpenAI、HuggingFace 旧案例和 Fable 几个月前的事件)。需要有人把"能力"与"护栏"落到具体环境,建立实证基础供政策参考。
政策制定者应如何与评估者合作?Rayan 说首先要有数据直通渠道:Vals 定期向行政/立法分支简报模型能力与风险发现,帮助他们追踪趋势而非盲目预测。Vals 不给政策建议(那是立法者的活),但如果立法者认为(比如)18 岁以下心理健康风险或生物安全风险需要标准化限制模型发布流程,那就是他们定政策,商务部、SEC 等执行分支确保企业安全采纳。
💡
这段定义了 AI 治理的"三权分立":政府定规则、私营评估者提供技术核查、实验室接受审查。类比核武器"trust but verify"(Reagan 名言):习近平与特朗普可能会面,但没有核查机制——共享评估语言(如核武器飞越检查)将是地缘稳定的前提。
⚡
政府恐惧清单(生物、网络)是否会遗漏真正风险?第三方评估者会否被监管俘获,沦为"合规橡皮章"?
7) 地缘博弈:主权 AI 与全球标准化的未来 — 33:45 🎧 · ▶️
💬
Jennifer 引入地缘视角:评估反映模型开发者的价值观——中国开源模型无法自由讨论 CCP,不同国家 benchmark 侧重不同(进攻性 vs 防御性网络能力)。Rayan 坦言从理想主义视角看,主权 AI 投资极其低效:各国复制数据中心、数据工程、训练大模型,本可合并。但现实是投资在加速,需要共享评估语言来沟通风险框架、对齐标准。他再提"trust but verify":习特下月可能会面,但缺核查机制——评估共享语言类似核武器时代的飞越检查,让各国能审计对方能力。
Ben 问如何协调全球政策——在美国已够难,跨国更甚,各国政府互相竞争。Rayan 承认没有完美答案,但提出婴儿步:网络安全、生物安全是各国共同关切,可先对齐。长期最有趣的是 RSI 可能性——某国/公司若实现"runaway"自我改进,产生未知模型,其他人无法理解其运作。建立共享的 RSI 发展速度描述,划出"舒适区"与"超速区",将是各国联合对话的关键。这也是为何闭源实验室研究者呼吁政府间联合对话。
Jennifer 问未来景观。Rayan 强调 Vals 专注构建捕捉前沿的 benchmark:只要前沿出现新能力或风险,就做成可文档化的评估放上 Val.AI。网络安全举例:历史工作集中在代码漏洞、内存泄漏,但最大风险在基础设施层(企业云、电网)——需模拟更大环境来测试进攻/防御能力。确保评估反映这些新领域,是 Vals 价值所在。他们坚信最有价值的商业模式是激励对齐于高质量评估,而非支持智能开发或模型自我改进流程。
Erik/Ben 感谢 Rayan,节目结束。
💡
地缘层面,评估标准正成为"软权力"与"核查协议"——就像冷战核武器条约需要飞越检查,AI 时代需要共享 benchmark 语言防止"runaway AGI"触发军备竞赛或误判。RSI 是终极风险点:谁先实现自我改进闭环,谁可能单方面领先到无法制衡。
⚡
中美能否真正就 benchmark 达成共识?还是各自建立平行标准体系(如互联网分裂)?主权 AI 虽低效,但对国家安全、数据主权是否有无法妥协的理由?
人物与机构
- Rayan Krishnan:Vals CEO,评估与 benchmark 研究背景,2024 年创立 Vals
- Lynx:Vals 联创,早期通宵跑评估
- Ben Horowitz:a16z 联创,本期联合主持,与 Marc Andreessen 常赴华盛顿参与政策对话
- Erik Torenberg:主持人
- Jennifer Li:主持人
- Vals:第三方 AI 模型评估机构,2024 年发布首批 benchmark,产品包括 ValSmith(企业代码库 benchmark 生成工具)
- Meta:Llama 4 在公开 benchmark 表现优异但私有测试露馅
- Demis Hassabis:DeepMind CEO,呼吁第三方评估生态
- OpenAI、Anthropic、Cognition(Devon)、DeepSeek:转写中提及的模型/工具提供商
- Steve:Vals 内部自动化系统(戏称第 0 号员工)
- Fortune 10 公司:匿名案例,工程师 $100/天 Claude Code 预算,4pm 重置导致生产力时段扭曲
数字与证据
- 6 小时:新模型发布前 Vals 的典型预发布评估窗口
- $100 → $300/天:Fortune 10 公司工程师 AI 预算,从 100 美元涨到 300(接近月薪)
- 4-6pm:该公司最高产时段(rate limit 4pm 重置)
- 1-20 亿 token/天:Vals 工程师在不限量实验月的日常消耗
- 60 亿 token:单个工程师峰值日消耗
- $150 万:Vals 一个月 token 支出(10 倍员工工资总和)
- ImageNet 百万级样本 → 50 个全栈应用:评估范式从"大样本、单标签"转向"小样本、复杂标准"
- 70% benchmark 饱和触发废弃(推测,非明确数字,但体现主动迭代策略)
- 10^26 flops:政府早期定义"前沿模型"的粗糙标准
- 30/60 天等待期:政策提案中的模型发布审查周期
金句
-
"Every time a new trillion dollar industry emerges, there's a need for this independent testing group."
——Rayan Krishnan,论证独立评估的历史必然性 -
"Always a higher peak."
——Vals 非正式座右铭(印在衬衫上),象征永不停歇的 benchmark 迭代 -
"Token spend may start to eclipse salary spend."
——Rayan,预言 AI 经济学拐点 -
"Trust but verify."
——Reagan 名言,Rayan 借用类比 AI 地缘核查机制 -
"A firm really is just its eval."
——Rayan,论企业长期竞争力由其"可测量性"决定 -
"We never want to be a lagging indicator or a delay to a model release."
——Rayan,阐述 Vals 的速度原则 -
"If you can solve this specific problem then you're at this level" — that's hackable and too narrow.
——Ben,批评公开 benchmark 的局限 -
"The government is particularly ill-suited to do the latter, particularly over time."
——Ben,论政府不适合执行快速迭代的技术评估 -
"The narrative and what actually happens in the real world — there's a gap."
——Jennifer,指出政策讨论与实际部署的脱节
洞见与延伸背景
-
Benchmark 污染的经济学:公开数据集天然会被过拟合(Goodhart's law:"When a measure becomes a target, it ceases to be a good measure")。Vals 的私有 hold-out 策略类似学术界的"held-out test set",但更激进——主动废弃饱和 benchmark,迫使实验室持续面对未知。
-
评估即服务的双边市场:Vals 既服务实验室(证明新模型值得溢价)又服务企业(选择最优 ROI 配置),这是典型平台模式——但需极度注意激励对齐,避免 Enron 式"审计即咨询"的利益冲突。
-
Token 经济学的微观样本:$150 万/月 = 10 倍工资,意味着若推广到全员全年,token 成本可能达工资总额的 10 倍——这对 SaaS 定价、VC 估值模型、企业成本结构都是颠覆性变量。订阅制 vs 按 token 计费将成为关键商业模式之争。
-
AI-complete 评估的哲学困境:人类智能尚无统一标准(IQ 争议、SAT 争议、"合伙人 vs 助理"无明确测试),要求 AI 评估先解决这一哲学问题——Vals 实际在做"为知识工作建立操作性定义"的元任务,这可能比模型本身更难。
-
RSI 作为"奇点前哨":递归自我改进是 AGI 的经典路径(Bostrom《Superintelligence》核心场景)。Vals 的 RSI index 尝试分解这一宏大问题为可测代理任务(预训练、后训练、harness 工程),但真正的 RSI 可能呈现"相变"而非线性爬坡——benchmark 能否提前预警?
-
地缘评估标准的"巴尔干化"风险:中美若各自建立平行 benchmark 体系(如互联网主权、技术标准分裂),全球 AI 生态可能彻底割裂。"trust but verify"理想美好,但冷战核查依赖卫星等物理手段,AI 能力更难核查(模型可隐藏、能力可伪装)。
-
ValSmith 的"GitHub as eval"范式:用历史代码库生成 benchmark,假设未来任务与过去相似——但 AI 最大价值可能在"做人类从未做过的事"(如科学发现),这类任务无历史数据可参考。
-
政策的"证据饥渴":Rayan 多次强调"抽象讨论"vs"实证数据"——这呼应 OpenAI 等实验室的"preparedness framework"尝试,但政府历史上在技术预测上屡屡失败(如互联网早期监管),Vals 能否提供足够前瞻性的证据?
争议与需核实
-
Llama 4 案例细节:转写未给出具体 benchmark 名称、分数对比,需核实 Vals 当时发布的报告。Meta 是否公开回应过这一差异?
-
$150 万 token 支出的真实性:这是极端实验场景(不限量一个月),但 Rayan 未说明团队规模、工程师数量、具体任务类型——若团队只有 5 人 vs 50 人,意义完全不同。需要更多上下文。
-
"10 倍工资"计算:$150 万/月 ÷ 10 = $15 万/月工资总额,意味着团队月薪总和约 15 万美元。若团队 10 人,人均 1.5 万/月($18 万年薪),符合硅谷工程师水平;若 50 人则偏低。需确认团队规模。
-
政府 10^26 flops 标准:这可能指 2023 年 Biden 行政令中的算力阈值,但转写未明确——需核实具体政策文件。
-
习特会面时间:Rayan 说"下月"(录制时间推测 2026 年 8 月?),但转写发布于 2026-09-09,时间线需核实。
-
Cognition Devon 的 token 效率:Vals 发现其"非常 token 高效",但未给出与其他工具(如 Cursor、GitHub Copilot)的对比数据——需要 ValSmith 报告佐证。
-
主权 AI"低效"判断:Rayan 从技术视角看复制投资低效,但各国可能有数据主权、供应链安全、审查控制等非技术理由——这不是纯粹的效率问题。
-
Vals 的收入模式:转写未透露 Vals 如何盈利(实验室付费?企业订阅?ValSmith SaaS?),商业模式不明可能影响独立性判断。
行动建议
给企业决策者:
- 立即审计 AI 支出结构:Token 成本可能在 6-12 个月内超过部分团队工资,需建立 tracking 机制(按团队、按任务类型)。
- 试点 ValSmith 或类似工具:用私有代码库生成 benchmark,对比不同模型/harness 的性能与成本——可能发现"Sonnet 比 Opus 贵"这类反直觉结果。
- 建立内部 eval 能力:Rayan 建议即便用第三方,也要培养内部专长——至少能定义"我们的合伙人 vs 助理差异是什么"。
- 从订阅制开始:若 token 消耗难控,优先选择固定订阅价格的工具(如 Devon),降低预算爆炸风险。
给 AI 实验室:
- 主动拥抱第三方评估:与其等 Llama 4 式翻车,不如提前与 Vals 等合作发布独立报告,增强市场信任。
- 投资 hold-out benchmark 构建:内部保留一部分永不公开、永不训练的评估集,作为真实能力的"北极星"。
- 参与政策对话时带数据:Ben 和 Rayan 都强调"证据 vs 抽象",实验室去华盛顿前应准备具体能力/风险数据,而非只谈假设场景。
给政策制定者:
- 建立"评估者资格认证"体系:如果第三方评估成为监管基础设施,需定义谁有资格做评估(避免"野鸡认证")。
- 要求实证而非承诺:不接受实验室的"我们内部测过,很安全"——要求独立第三方 sign-off,类似药品 FDA 审批。
- 投资公共 benchmark 基础设施:政府可资助构建"国家级 hold-out 数据集"(如医疗、法律、网络安全),供认证评估者使用但永不公开。
给研究者:
- 关注 RSI benchmark 方法论:Vals 的代理任务分解法(预训练、后训练、harness 工程)可能是研究 RSI 的新范式,值得学术跟进。
- 研究"评估的评估":谁来评估 Vals?需要 meta-benchmark 来验证第三方评估的质量,避免"评级机构"重蹈 2008 金融危机覆辙。
给投资人:
- 重估 AI 基础设施赛道:评估即服务(EaaS)可能成为继模型、应用之后的第三大品类——Vals、Scale AI(标注+评估)、HumanLoop 等值得关注。
- 审查被投企业的 token 经济学:若某 portfolio 公司 token 支出/工资比 >50%,需重新建模 unit economics。
来源
-
播客:a16z Podcast - Who Grades the AI Models?
- 🎧
- ▶️
- 📄 Episode 页面
-
转写来源:YouTube 自动字幕(youtube_auto_captions)
-
延伸阅读:
- Vals 官网:val.ai(推测,转写未给出)
- Biden 行政令(2023)关于 AI 安全与算力阈值
- Nick Bostrom《Superintelligence》(2014)关于 RSI 与智能爆炸
- Goodhart's Law 与 Campbell's Law(衡量指标成为目标时失效)
- 2008 金融危机中评级机构的角色(Moody's、S&P 利益冲突)
- OpenAI Preparedness Framework、Anthropic RSL(Responsible Scaling Policy)
制作说明:本详解基于 YouTube 自动字幕转写,时间戳可能存在 ±5 秒误差;部分专有名词(如"Steve"系统、具体 benchmark 名称)依赖转写音译,需以官方文档为准;$150 万 token 支出等数字为嘉宾口述,未经第三方审计;地缘政策部分(习特会面)时间线需结合录制日期核实。