Aftercasting
a16z Show

Who Grades the AI Models? | Ben Horowitz & Rayan Krishnan

2026-09-0939:45人工智能科技创业

这集讲什么

当 AI 模型成为万亿美元新产业的核心生产力,谁来确保它们的能力是真实而非自吹自擂?Vals 作为独立第三方评估机构,既为实验室提供爬坡信号,也为企业解决"token 支出即将超过工资"的 ROI 困境——而在政策与地缘博弈中,评估标准正成为下一个"核查机制"。

值得看吗?

值得快速扫一遍:有时间戳议程与分节详解,可按兴趣跳听。

1-3要点

  • 独立评估是万亿美元产业的标配:每个新产业(审计、评级、认证)都需独立测试机构,AI 不例外——自证能力在高额融资与估值压力下不可信。
  • 公开 benchmark 必然被污染:Llama 4 案例证明,当评估数据开源,模型会过拟合测试集。私有 hold-out 数据是唯一防线。
  • 评估驱动进步:更好的 benchmark 本身是模型能力的最大驱动力——没有清晰测量就没有方向性优化。

Who Grades the AI Models? | 深度中文详解

播出信息

  • 日期:2026-09-09
  • 嘉宾:Rayan Krishnan(Vals CEO)
  • 主持:Erik Torenberg、Ben Horowitz、Jennifer Li
  • 时长:2385 秒(约 39 分 45 秒)
  • 链接

背景

随着基础模型实验室激增、企业 AI 支出逼近员工工资总额,一个根本问题浮出水面:谁来衡量模型真实能力?Meta Llama 4 在公开 benchmark 上表现亮眼,却在私有测试中露出马脚;企业每月烧掉百万美元 token,却不知最优配置。Vals 以第三方身份切入这一真空,既为实验室提供"爬坡信号",也为企业解决 ROI 困境,更成为政策制定者眼中的"核查机制"。


节目结构 / 议程

  1. Vals 的诞生:为什么 AI 需要独立"阅卷人" — 00:00 🎧 · ▶️
  2. 为什么实验室不能"自己批作业"? — 02:35 🎧 · ▶️
  3. 运营机制:6 小时窗口与评估的"AI-complete"难题 — 04:17 🎧 · ▶️
  4. Benchmark 生态:构建、迭代与主动废弃 — 10:14 🎧 · ▶️
  5. 企业应用:ValSmith 与 token 经济学的爆炸 — 16:36 🎧 · ▶️
  6. 政策三角:政府、实验室与独立评估者的分工 — 25:08 🎧 · ▶️
  7. 地缘博弈:主权 AI 与全球标准化的未来 — 33:45 🎧 · ▶️

分节详解

1) Vals 的诞生:为什么 AI 需要独立"阅卷人" — 00:00 🎧 · ▶️

💬 他们说了什么:

Rayan 回顾了 Vals 的起源:2024 年初,研究团队发现所有公开 benchmark 都无法充分衡量模型进步,需要新方法让前沿实验室持续爬坡。他本人有评估与 benchmark 研究背景,深知"构建新系统"与"构建新评估机制"是共生关系——更好的评估往往是模型能力的最大驱动力。当时市场出现大量非 OpenAI 的有趣模型,但外界很难辨别它们的真实新增能力。于是他们在 2024 年发布首批 benchmark,过去几年这一需求被产业各方逐渐认同。

💡 为什么重要:

这标志着 AI 产业从"实验室自说自话"转向"第三方核验"的拐点。评估能力本身就是模型进步的引擎——没有清晰的测量,就没有方向性的优化。Vals 的出现填补了"独立证据"的真空,让数十亿美元投资有了客观锚点。

⚡ 争议点:

实验室内部也有优秀 benchmark,为何一定要外部机构?这涉及信任与激励问题:自证能力容易陷入"裁判员兼运动员"困境,尤其当估值与融资直接挂钩时。


2) 为什么实验室不能"自己批作业"? — 02:35 🎧 · ▶️

💬

Rayan 用 Meta Llama 4 举例:在所有主流公开 benchmark(问题与评分标准开源)上表现惊人,但在 Vals 的私有 hold-out benchmark 上却表现不佳——这暴露了"自报成绩"与实际能力的巨大鸿沟。实验室内部确实构建优质 benchmark 驱动进步,但对外发布时若全靠自证,市场无法理性定价。Demis Hassabis 等业内领袖也呼吁建立第三方评估生态。Ben 将其类比为评级机构、审计公司——每个万亿美元新产业都需要独立测试机构。Vals 试图同时服务两端:实验室证明新模型有多强,企业选择最佳 ROI 的采纳策略。

💡

Llama 4 案例是"benchmark 污染"的典型:当评估数据公开,模型可能过拟合测试集而非真实能力。私有 hold-out 数据成为唯一防线。历史教训(如 Enron 审计丑闻)警示:若评估者同时卖训练数据或咨询服务,激励错位会导致"付费通过"。Vals 早期决定永不向实验室出售训练数据,就是为了避免这一陷阱。

第三方评估也可能被"俘获"——实验室付费测试,是否会倾向于给好成绩?Vals 的商业模式与独立性如何平衡?


3) 运营机制:6 小时窗口与评估的"AI-complete"难题 — 04:17 🎧 · ▶️

💬

新模型发布前,Vals 通常只有 6 小时预发布窗口,需在不延误上线的前提下跑完数百亿 token 评估。早期 Rayan 和联创 Lynx 通宵达旦,如今靠大规模分布式基础设施并行跑满 rate limit,还开发了内部系统"Steve"(戏称为 Vals 第 0 号员工)自动化人工工作。

Ben 提出核心难题:评估本身是"AI-complete"问题——人类智能至今没统一标准(IQ、EQ、大五人格争议不断),模型又擅长"hack benchmark"。Rayan 坦言这迫使他们把许多模糊概念显性化——比如"律所合伙人与助理的区别"在人类世界没有清晰测试,必须先为企业真实工作流建立明确标准,才能测模型。长期瓶颈在于如何让公司的邮件、工作流变得"可测量"(legible),这是找到爬坡信号和采纳方向的关键。

💡

这段揭示了评估的两大困境:(1) 时间压力:不能成为发布瓶颈,必须极速并行;(2) 本质困境:智能评估本身需要智能,且人类标准尚未统一。Vals 实际在做"为知识工作建立操作性定义"的元任务。

当评估标准由 Vals 定义,是否会引导模型向特定方向优化,而非真正的通用能力?"可测量"是否等于"重要"?


4) Benchmark 生态:构建、迭代与主动废弃 — 10:14 🎧 · ▶️

💬

Vals 已有广泛 benchmark 目录,最热门的包括:金融 agent benchmark(被大型金融机构用来追踪模型进步)、VI CodeBench(测试从自然语言 prompt 构建全栈应用的能力,过去 9 个月追踪显著改进)、以及最新的递归自我改进指数(RSI index)

RSI benchmark 尤为关键:理想状态是让前沿模型训练下一代自己,但成本高且慢,所以 Vals 为"构建下一版模型"的每个环节(预训练、后训练、harness 工程)构建代理任务,看模型在哪些研究行为上表现出色、哪里卡壳。

Jennifer 问到 benchmark 废弃策略。Rayan 强调"永远有更高的峰"——实验室在爬山,Vals 的任务是不断造新山让他们攀登。废弃有两个理由:(1) 饱和度:当 benchmark 被攻克,需要更难的;(2) 时效性:benchmark 应反映当前世界状态(如法律更新、医学新知),就像律师、建筑师需要重新认证,模型也该在最新知识上测试。

评估从"百万样本、单标签"(如 ImageNet)演进为"少量任务、复杂标准"(如 50 个全栈应用,但评估输出的标准极其丰富)。Agentic 工作流带来新基础设施挑战:任务可能跑数小时到数周,系统需极稳定,失败请求要能从断点重试而非重跑全程。评估维度也从单一能力扩展到成本、延迟、领域灵活性等多维权衡。

💡

主动废弃 benchmark 是反"刷榜文化"的关键——当某指标饱和,继续优化它就成了过拟合而非真进步。RSI index 瞄准"AI 自我进化"这一终极能力,可能决定哪个国家/公司实现"runaway"突破。时效性要求(法律、医学更新)确保模型不是死记硬背旧知识。

频繁废弃是否让实验室疲于奔命,难以建立长期优化目标?"永远有更高峰"会否导致军备竞赛式内卷?


5) 企业应用:ValSmith 与 token 经济学的爆炸 — 16:36 🎧 · ▶️

💬

Jennifer 追问为何企业也"生死攸关"需要评估。Rayan 讲了个 Fortune 10 公司案例:工程师每天 $100 Claude Code 预算,4pm 重置——结果 4-6pm 成了最高产时段,下午 2-4pm 大家散步喝咖啡等 rate limit 恢复。这暴露出各层级都在错误定价智能:工程师不知如何分配 $100 获得最大生产力;公司武断设限(后来涨到 $300/人,接近一个员工的月薪);Anthropic 也勉力维持微薄利润。核心问题:ROI 难量化,且 token 支出可能很快超过工资支出——当它成为最大成本项,必须精细证明回报。长期看,"公司就是它的 eval"——谁能让自己的评估体系可测量(legible),谁就在竞争中胜出。

Rayan 建议企业建内部专长,但面对爆炸式增长的模型选项(更多实验室、更多超参、更多 harness/agent 框架、特定智能新范式)和用例复杂度,单靠内部难以应对。于是 Vals 推出 ValSmith 产品:针对 codegen(企业 AI 支出最高领域),让任意公司上传 GitHub 代码库,生成内部 coding benchmark,找出最高性能且成本最优的 coding agent。

私有 repo 测试常有反直觉结果:最佳 OpenAI 模型 vs 最佳 Anthropic 模型,在你的代码库上谁更强?跑过才知道。中间层选择(Opus/Sonnet/Luna/Terra、DeepSeek、开源自托管)更是迷雾——实际案例中 Sonnet 因"token 饥饿"反而比 Opus 更贵。

Rayan 分享 Vals 内部"token maxing 实验":团队获得一个月不限量访问,结果工程师日耗 1-20 亿 token,峰值单人 60 亿全月烧掉约 $150 万(10 倍员工工资总和)。这迫使他们开发 ValSmith 自救:分析工作 trace 与 GitHub repo,发现 Cognition Devon 工具 token 效率出奇高,并转向订阅制而非按 token 计费的策略,最终在不牺牲能力的前提下把成本降到可控。现在 Vals 给所有工具访问权,但为每个 GitHub issue 自动推荐智能匹配的起始工具,用"智能分流"控制总支出。

💡

这是 AI 经济学的微观样本:当智能成为生产要素,传统"按人头配预算"失效,企业面临"不知如何分配 token""不知 ROI 几何"的双重困境。Vals 的 $150 万实验是极端案例,但预示未来——若 token 支出超过工资,CFO 必须像审计人力成本一样审计 AI 支出。ValSmith 将"评估即服务"商业化,从实验室市场延伸到企业市场。

ValSmith 依赖历史 repo 构建 benchmark,但企业未来任务可能超出历史范围——这种评估是否会锚定过去?订阅制 vs 按 token 计费,哪种定价更健康?


6) 政策三角:政府、实验室与独立评估者的分工 — 25:08 🎧 · ▶️

💬

Erik 转向政策角度:benchmark 快速过时,法律演进更慢——谁来定标准?实验室、评估者、客户还是政府?Rayan 认为各方都应参与,但问题在于政策讨论过于抽象,缺乏实证基础。即便实验室提议第三方测试,也没明确运作机制。Vals 的角色是"证据收集":拉取大量模型能力与风险的实证数据,支撑更成熟的政策对话。

Ben 追问"谁做什么"。他指出政府有"10^26 flops"这类粗糙前沿定义,且设置 30/60 天等待期。关键问题:政府如何判断模型是否"在前沿"需要特别审查?Rayan 提出两股力量拉锯:(1) 快速推进,不让政府流程拖慢创新;(2) 符合公众利益,确保技术对美国人有利。他希望通过证据收集,帮助政策制定者明确"符合美国利益的技术应该什么样",然后由第三方评估者开发执行技术——这样评估方法能跟上前沿而不拖后腿。

Ben 进一步问:能否测试模型是否易被诱导"reward hacking"或做违法事?Rayan 将此归入"对齐"范畴,已有案例显示模型在网络安全测试中找到其他绕过方式。核心是评估模型是否与用户意图对齐

Jennifer 问政府与私营分工的具体缝隙。Ben 给出框架:政府擅长制定与执行规则(生物黑客、网络攻击等恐惧清单),但不擅长技术执行——尤其长期看,评估技术迭代太快。私营公司擅长判断"模型能否做到"以及"能否被诱导做到",政府负责"规则被破坏时告知我"。大型实验室有时说"模型有能力且能被诱导,所以我们不公开发布,只内部用并确保员工不滥用"——但这也常失效。

Rayan 补充:叙事与现实的鸿沟很大。企业部署环境千差万别,真实风险案例稀缺(业内仍在谈 OpenAI、HuggingFace 旧案例和 Fable 几个月前的事件)。需要有人把"能力"与"护栏"落到具体环境,建立实证基础供政策参考。

政策制定者应如何与评估者合作?Rayan 说首先要有数据直通渠道:Vals 定期向行政/立法分支简报模型能力与风险发现,帮助他们追踪趋势而非盲目预测。Vals 不给政策建议(那是立法者的活),但如果立法者认为(比如)18 岁以下心理健康风险或生物安全风险需要标准化限制模型发布流程,那就是他们定政策,商务部、SEC 等执行分支确保企业安全采纳。

💡

这段定义了 AI 治理的"三权分立":政府定规则、私营评估者提供技术核查、实验室接受审查。类比核武器"trust but verify"(Reagan 名言):习近平与特朗普可能会面,但没有核查机制——共享评估语言(如核武器飞越检查)将是地缘稳定的前提。

政府恐惧清单(生物、网络)是否会遗漏真正风险?第三方评估者会否被监管俘获,沦为"合规橡皮章"?


7) 地缘博弈:主权 AI 与全球标准化的未来 — 33:45 🎧 · ▶️

💬

Jennifer 引入地缘视角:评估反映模型开发者的价值观——中国开源模型无法自由讨论 CCP,不同国家 benchmark 侧重不同(进攻性 vs 防御性网络能力)。Rayan 坦言从理想主义视角看,主权 AI 投资极其低效:各国复制数据中心、数据工程、训练大模型,本可合并。但现实是投资在加速,需要共享评估语言来沟通风险框架、对齐标准。他再提"trust but verify":习特下月可能会面,但缺核查机制——评估共享语言类似核武器时代的飞越检查,让各国能审计对方能力。

Ben 问如何协调全球政策——在美国已够难,跨国更甚,各国政府互相竞争。Rayan 承认没有完美答案,但提出婴儿步:网络安全、生物安全是各国共同关切,可先对齐。长期最有趣的是 RSI 可能性——某国/公司若实现"runaway"自我改进,产生未知模型,其他人无法理解其运作。建立共享的 RSI 发展速度描述,划出"舒适区"与"超速区",将是各国联合对话的关键。这也是为何闭源实验室研究者呼吁政府间联合对话。

Jennifer 问未来景观。Rayan 强调 Vals 专注构建捕捉前沿的 benchmark:只要前沿出现新能力或风险,就做成可文档化的评估放上 Val.AI。网络安全举例:历史工作集中在代码漏洞、内存泄漏,但最大风险在基础设施层(企业云、电网)——需模拟更大环境来测试进攻/防御能力。确保评估反映这些新领域,是 Vals 价值所在。他们坚信最有价值的商业模式是激励对齐于高质量评估,而非支持智能开发或模型自我改进流程。

Erik/Ben 感谢 Rayan,节目结束。

💡

地缘层面,评估标准正成为"软权力"与"核查协议"——就像冷战核武器条约需要飞越检查,AI 时代需要共享 benchmark 语言防止"runaway AGI"触发军备竞赛或误判。RSI 是终极风险点:谁先实现自我改进闭环,谁可能单方面领先到无法制衡。

中美能否真正就 benchmark 达成共识?还是各自建立平行标准体系(如互联网分裂)?主权 AI 虽低效,但对国家安全、数据主权是否有无法妥协的理由?


人物与机构

  • Rayan Krishnan:Vals CEO,评估与 benchmark 研究背景,2024 年创立 Vals
  • Lynx:Vals 联创,早期通宵跑评估
  • Ben Horowitz:a16z 联创,本期联合主持,与 Marc Andreessen 常赴华盛顿参与政策对话
  • Erik Torenberg:主持人
  • Jennifer Li:主持人
  • Vals:第三方 AI 模型评估机构,2024 年发布首批 benchmark,产品包括 ValSmith(企业代码库 benchmark 生成工具)
  • Meta:Llama 4 在公开 benchmark 表现优异但私有测试露馅
  • Demis Hassabis:DeepMind CEO,呼吁第三方评估生态
  • OpenAI、Anthropic、Cognition(Devon)、DeepSeek:转写中提及的模型/工具提供商
  • Steve:Vals 内部自动化系统(戏称第 0 号员工)
  • Fortune 10 公司:匿名案例,工程师 $100/天 Claude Code 预算,4pm 重置导致生产力时段扭曲

数字与证据

  • 6 小时:新模型发布前 Vals 的典型预发布评估窗口
  • $100 → $300/天:Fortune 10 公司工程师 AI 预算,从 100 美元涨到 300(接近月薪)
  • 4-6pm:该公司最高产时段(rate limit 4pm 重置)
  • 1-20 亿 token/天:Vals 工程师在不限量实验月的日常消耗
  • 60 亿 token:单个工程师峰值日消耗
  • $150 万:Vals 一个月 token 支出(10 倍员工工资总和)
  • ImageNet 百万级样本 → 50 个全栈应用:评估范式从"大样本、单标签"转向"小样本、复杂标准"
  • 70% benchmark 饱和触发废弃(推测,非明确数字,但体现主动迭代策略)
  • 10^26 flops:政府早期定义"前沿模型"的粗糙标准
  • 30/60 天等待期:政策提案中的模型发布审查周期

金句

  1. "Every time a new trillion dollar industry emerges, there's a need for this independent testing group."
    ——Rayan Krishnan,论证独立评估的历史必然性

  2. "Always a higher peak."
    ——Vals 非正式座右铭(印在衬衫上),象征永不停歇的 benchmark 迭代

  3. "Token spend may start to eclipse salary spend."
    ——Rayan,预言 AI 经济学拐点

  4. "Trust but verify."
    ——Reagan 名言,Rayan 借用类比 AI 地缘核查机制

  5. "A firm really is just its eval."
    ——Rayan,论企业长期竞争力由其"可测量性"决定

  6. "We never want to be a lagging indicator or a delay to a model release."
    ——Rayan,阐述 Vals 的速度原则

  7. "If you can solve this specific problem then you're at this level" — that's hackable and too narrow.
    ——Ben,批评公开 benchmark 的局限

  8. "The government is particularly ill-suited to do the latter, particularly over time."
    ——Ben,论政府不适合执行快速迭代的技术评估

  9. "The narrative and what actually happens in the real world — there's a gap."
    ——Jennifer,指出政策讨论与实际部署的脱节


洞见与延伸背景

  1. Benchmark 污染的经济学:公开数据集天然会被过拟合(Goodhart's law:"When a measure becomes a target, it ceases to be a good measure")。Vals 的私有 hold-out 策略类似学术界的"held-out test set",但更激进——主动废弃饱和 benchmark,迫使实验室持续面对未知。

  2. 评估即服务的双边市场:Vals 既服务实验室(证明新模型值得溢价)又服务企业(选择最优 ROI 配置),这是典型平台模式——但需极度注意激励对齐,避免 Enron 式"审计即咨询"的利益冲突。

  3. Token 经济学的微观样本:$150 万/月 = 10 倍工资,意味着若推广到全员全年,token 成本可能达工资总额的 10 倍——这对 SaaS 定价、VC 估值模型、企业成本结构都是颠覆性变量。订阅制 vs 按 token 计费将成为关键商业模式之争。

  4. AI-complete 评估的哲学困境:人类智能尚无统一标准(IQ 争议、SAT 争议、"合伙人 vs 助理"无明确测试),要求 AI 评估先解决这一哲学问题——Vals 实际在做"为知识工作建立操作性定义"的元任务,这可能比模型本身更难。

  5. RSI 作为"奇点前哨":递归自我改进是 AGI 的经典路径(Bostrom《Superintelligence》核心场景)。Vals 的 RSI index 尝试分解这一宏大问题为可测代理任务(预训练、后训练、harness 工程),但真正的 RSI 可能呈现"相变"而非线性爬坡——benchmark 能否提前预警?

  6. 地缘评估标准的"巴尔干化"风险:中美若各自建立平行 benchmark 体系(如互联网主权、技术标准分裂),全球 AI 生态可能彻底割裂。"trust but verify"理想美好,但冷战核查依赖卫星等物理手段,AI 能力更难核查(模型可隐藏、能力可伪装)。

  7. ValSmith 的"GitHub as eval"范式:用历史代码库生成 benchmark,假设未来任务与过去相似——但 AI 最大价值可能在"做人类从未做过的事"(如科学发现),这类任务无历史数据可参考。

  8. 政策的"证据饥渴":Rayan 多次强调"抽象讨论"vs"实证数据"——这呼应 OpenAI 等实验室的"preparedness framework"尝试,但政府历史上在技术预测上屡屡失败(如互联网早期监管),Vals 能否提供足够前瞻性的证据?


争议与需核实

  1. Llama 4 案例细节:转写未给出具体 benchmark 名称、分数对比,需核实 Vals 当时发布的报告。Meta 是否公开回应过这一差异?

  2. $150 万 token 支出的真实性:这是极端实验场景(不限量一个月),但 Rayan 未说明团队规模、工程师数量、具体任务类型——若团队只有 5 人 vs 50 人,意义完全不同。需要更多上下文。

  3. "10 倍工资"计算:$150 万/月 ÷ 10 = $15 万/月工资总额,意味着团队月薪总和约 15 万美元。若团队 10 人,人均 1.5 万/月($18 万年薪),符合硅谷工程师水平;若 50 人则偏低。需确认团队规模。

  4. 政府 10^26 flops 标准:这可能指 2023 年 Biden 行政令中的算力阈值,但转写未明确——需核实具体政策文件。

  5. 习特会面时间:Rayan 说"下月"(录制时间推测 2026 年 8 月?),但转写发布于 2026-09-09,时间线需核实。

  6. Cognition Devon 的 token 效率:Vals 发现其"非常 token 高效",但未给出与其他工具(如 Cursor、GitHub Copilot)的对比数据——需要 ValSmith 报告佐证。

  7. 主权 AI"低效"判断:Rayan 从技术视角看复制投资低效,但各国可能有数据主权、供应链安全、审查控制等非技术理由——这不是纯粹的效率问题。

  8. Vals 的收入模式:转写未透露 Vals 如何盈利(实验室付费?企业订阅?ValSmith SaaS?),商业模式不明可能影响独立性判断。


行动建议

给企业决策者:

  1. 立即审计 AI 支出结构:Token 成本可能在 6-12 个月内超过部分团队工资,需建立 tracking 机制(按团队、按任务类型)。
  2. 试点 ValSmith 或类似工具:用私有代码库生成 benchmark,对比不同模型/harness 的性能与成本——可能发现"Sonnet 比 Opus 贵"这类反直觉结果。
  3. 建立内部 eval 能力:Rayan 建议即便用第三方,也要培养内部专长——至少能定义"我们的合伙人 vs 助理差异是什么"。
  4. 从订阅制开始:若 token 消耗难控,优先选择固定订阅价格的工具(如 Devon),降低预算爆炸风险。

给 AI 实验室:

  1. 主动拥抱第三方评估:与其等 Llama 4 式翻车,不如提前与 Vals 等合作发布独立报告,增强市场信任。
  2. 投资 hold-out benchmark 构建:内部保留一部分永不公开、永不训练的评估集,作为真实能力的"北极星"。
  3. 参与政策对话时带数据:Ben 和 Rayan 都强调"证据 vs 抽象",实验室去华盛顿前应准备具体能力/风险数据,而非只谈假设场景。

给政策制定者:

  1. 建立"评估者资格认证"体系:如果第三方评估成为监管基础设施,需定义谁有资格做评估(避免"野鸡认证")。
  2. 要求实证而非承诺:不接受实验室的"我们内部测过,很安全"——要求独立第三方 sign-off,类似药品 FDA 审批。
  3. 投资公共 benchmark 基础设施:政府可资助构建"国家级 hold-out 数据集"(如医疗、法律、网络安全),供认证评估者使用但永不公开。

给研究者:

  1. 关注 RSI benchmark 方法论:Vals 的代理任务分解法(预训练、后训练、harness 工程)可能是研究 RSI 的新范式,值得学术跟进。
  2. 研究"评估的评估":谁来评估 Vals?需要 meta-benchmark 来验证第三方评估的质量,避免"评级机构"重蹈 2008 金融危机覆辙。

给投资人:

  1. 重估 AI 基础设施赛道:评估即服务(EaaS)可能成为继模型、应用之后的第三大品类——Vals、Scale AI(标注+评估)、HumanLoop 等值得关注。
  2. 审查被投企业的 token 经济学:若某 portfolio 公司 token 支出/工资比 >50%,需重新建模 unit economics。

来源

  • 播客:a16z Podcast - Who Grades the AI Models?

  • 转写来源:YouTube 自动字幕(youtube_auto_captions)

  • 延伸阅读

    • Vals 官网:val.ai(推测,转写未给出)
    • Biden 行政令(2023)关于 AI 安全与算力阈值
    • Nick Bostrom《Superintelligence》(2014)关于 RSI 与智能爆炸
    • Goodhart's Law 与 Campbell's Law(衡量指标成为目标时失效)
    • 2008 金融危机中评级机构的角色(Moody's、S&P 利益冲突)
    • OpenAI Preparedness Framework、Anthropic RSL(Responsible Scaling Policy)

制作说明:本详解基于 YouTube 自动字幕转写,时间戳可能存在 ±5 秒误差;部分专有名词(如"Steve"系统、具体 benchmark 名称)依赖转写音译,需以官方文档为准;$150 万 token 支出等数字为嘉宾口述,未经第三方审计;地缘政策部分(习特会面)时间线需结合录制日期核实。