Aftercasting
a16z Show

Can Open Source Keep AI Power From Concentrating?

2026-09-078:05人工智能科技

这集讲什么

Transformer 论文共同作者 Lukasz Kaiser 认为,当前 AI 权力集中是技术阶段性特征而非宿命,人类大脑证明分布式智能可行,下一代算法突破将重构 AI 经济学。

值得看吗?

值得快速扫一遍:有时间戳议程与分节详解,可按兴趣跳听。

1-3要点

  • 集中化是架构副产品,非 AI 本质:Transformer 的"全网数据依赖"导致规模竞赛,但这只是不到十年的技术路径,非终局。
  • 人类大脑是分布式智能的存在性证明:专家在小数据上的深度学习能力证明,比 Transformer 更优的算法路径已在自然界存在。
  • 硬件民主化已降低研究门槛:单张消费级 GPU(5090)算力超过 2017 年 Transformer 团队全部资源,个人研究者已具备探索新架构的能力。

开源能否阻止 AI 权力集中?|深度中文详解

播出信息

  • 节目:a16z Podcast
  • 播出日期:2026-09-07
  • 主持人:Sophia Dew(MTS)
  • 嘉宾:Lukasz Kaiser(《Attention Is All You Need》论文共同作者、AI 研究员)
  • 录制地:旧金山开源 AI Summit
  • 时长:485 秒(约 8 分钟)
  • Episode 页面a16z.simplecast.com

背景

2017 年《Attention Is All You Need》论文催生了 Transformer 架构,彻底改变了现代 AI。但九年后,AI 能力越强,所需资源越集中——训练前沿模型需要数十亿美元数据中心、全网数据抓取、庞大工程团队。在旧金山开源 AI Summit 上,该论文共同作者 Lukasz Kaiser 与 a16z 主持 Sophia Dew 探讨了一个核心悖论:Transformer 成就了 AI 的今天,但其架构特性正在加剧权力集中;而人类大脑作为分布式专家系统的存在,证明另一条技术路径不仅可能,而且可能更优

本期是对"开源能否解决集中化"这一命题的技术维度剖析:不回避 Transformer 的局限,不寄望道德呼吁,而是从算法经济学出发,论证为何当前集中化是暂时的、研究窗口正在打开、以及个人研究者如何参与这场变革。

节目结构 / 议程

  1. AI 权力集中的现实 — 00:00 集中化从何而来?数据中心、数据规模、订阅付费模式如何构成壁垒。

  2. Transformer 的内在集中化 — 01:08 为何"bigger, bigger, bigger"是当前范式的必然?Transformer 对全网数据的依赖与专用学习的失败。

  3. 人类大脑的反证与硬件民主化 — 02:35 为何说"我们就是证明"?5090 GPU 算力超越 2017 年团队资源意味着什么?

  4. 理论支撑:Ensembles 与分布式模型 — 04:17 为何分布式专精模型可能优于单一巨模型?基础研究提供的证据。

  5. 乐观的行动纲领 — 05:43 不要被当前状态吓倒:这只是技术的一个阶段,研究窗口正在打开。


分节详解

1) AI 权力集中的现实 — 00:00 🎧

核心论断:AI 能力突破(2024 年底编程代理可用)与资源集中化同步加剧,形成"大公司训练-用户付费订阅"的单向依赖结构。

Kaiser 开门见山指出 2024 年底到 2025 年初的分水岭——编程代理(coding agents)开始真正可用。这个时间点重要,因为它标志着 AI 从"展示性工具"进入"生产力替代"阶段。但能力飞跃的代价是:

  • 训练前置成本:需要"非常昂贵的数据中心"(very expensive data centers)
  • 数据垄断:需要"从互联网每个角落抓取数据"(scrape data from every corner of the internet)
  • 资金门槛:扩大规模需要"数十亿美元"(billions of dollars)

这不是道德问题,是 技术架构的经济学必然:当前 AI(以 Transformer 为核心)的性能提升路径是规模扩张(scaling),而规模扩张天然有利于资本与数据双重富集者。结果是用户被锁定在"订阅付费使用别人模型"的消费者角色,无法拥有自己的智能。

关键转折:但 Kaiser 紧接着抛出核心论点——"这只是当前技术的状态"(the current state of the technology),暗示集中化非宿命,而是特定架构的副产品。


2) Transformer 的内在集中化 — 01:08 🎧

核心论断:Transformer 架构的"全或无"特性(要么全网训练达到泛化,要么小数据训练表现糟糕)是当前集中化的技术根源,但这是架构缺陷而非 AI 本质。

Kaiser 用自己的发明解剖自己的发明:

"Transformers are really good if you train them on the whole internet and then they're reasonably smart. But if you try to say, you know, you just learn about this, then they're just stupid."
(Transformer 在全网训练后表现合理,但如果只让它学习特定领域,它就很蠢。)

这揭示了 Transformer 的根本性局限

  • 无法高效专用学习:不能像人类专家那样仅从领域数据中深度学习
  • 规模依赖:必须"bigger, bigger, bigger"才能逼近智能
  • 数据饥渴:需要"整个互联网"作为训练语料才能达到"reasonably smart"

但 Kaiser 强调两点防止技术决定论:

  1. 时间尺度:"Transformers are not even 10 years old"(Transformer 还不到十年),暗示当前范式远未定型
  2. 研究方向:"It's a research problem that hopefully gets solved"(这是有希望解决的研究问题),将集中化重新定义为技术债而非终局

隐含批判:当前大实验室(暗指 OpenAI 等)因产品化压力放弃了这类基础研究——"needs to do products and stuff",反而为开源社区和学术界创造了机会窗口。


3) 人类大脑的反证与硬件民主化 — 02:35 🎧

核心论断:人类大脑作为分布式、专精型、小数据学习的智能系统,已经证明了比 Transformer 更优的算法路径存在;单张消费级 GPU 算力超过 2017 年团队全部资源,证明研究窗口正在打开。

当被问及"是否存在让小玩家竞争的算法突破"时,Kaiser 给出了整场对话最有力的论证:

"We know it exists. We are the proof, right? Humans are not experts in everything. But in the field, there are experts, they're very good, sometimes better than our super-huge models."
(我们知道它存在。我们自己就是证明。人类不是所有领域的专家,但在各自领域,专家非常优秀,有时比超大模型更好。)

这个论证巧妙在三层:

  1. 存在性证明:无需假设,人类智能已运行数十万年
  2. 优势对比:领域专家用远小于"全网数据"的信息量,达到甚至超越超大模型的专业表现
  3. 架构线索:"There's not like one big brain of humanity"(不存在一个人类总大脑),暗示分布式多模型可能比单一巨模型更优

硬件民主化的实证:Kaiser 随后分享了震撼对比:

"I bought a 5090 RTX GPU. It has more power than the eight GPU machines we used as a team to do the Transformers research."
(我买了一张 5090 RTX GPU,它的算力超过我们团队当年做 Transformer 研究用的 8 张 GPU 机器。)

这个对比的深层含义:

  • 硬件民主化:2017 年需要团队级资源的研究,2025 年个人可负担(一张 5090 约 $1,600-2,000)
  • 能力边界:"You can't train a big LLaMA, but you can research and experiment on things"(不能训练大 LLaMA,但可以做研究和实验)——明确区分"复现现有范式"与"探索新范式",后者才是机会
  • 行动号召:"I think many people should"(我认为很多人应该这么做)

4) 理论支撑:Ensembles 与分布式模型 — 04:17 🎧

核心论断:基础研究(如 ensembles)已提供理论依据,证明分布式专精模型协作可能优于单一泛化巨模型——这不是玄学,而是有数学基础的研究方向。

主持人 Sophia 问出最关键的问题:"什么让你相信 AI 的未来会真正开放并赋能所有人?"

Kaiser 的回答从基本原理出发:

"I think fundamentally, it might be that, given a fixed amount of data, the best way to learn from it is to have a lot of distributed models. Strong on its own, but even stronger when they're [协作]."
(我认为从根本上讲,在给定固定数据量的情况下,最佳学习方式可能是拥有大量分布式模型。每个模型本身都很强,但协作时更强。)

技术支撑:Kaiser 提到 ensembles(集成学习)等基础研究已提供理论依据——多个专精模型协作可能优于单一泛化模型。这不是玄学,而是有数学基础的研究方向。

关键反转:当前范式(全网数据+单一巨模型)可能不是"最优解",而只是"当前技术约束下的局部最优"。真正的最优解是:

  • 不靠规模碾压,靠架构效率
  • 小数据专精学习 vs. 全网数据泛化学习
  • 分布式专家系统 vs. 单一全知模型

"We know there is an algorithm that's even better, and it can learn from much smaller data and be amazing at the things it's learning. This we are the proof."
(我们知道存在一种更好的算法,它可以从更小的数据中学习,并在所学内容上表现惊人。我们自己就是证明。)


5) 乐观的行动纲领 — 05:43 🎧

核心论断:当前集中化是"技术进程中的一步"而非终点,大实验室的产品化压力为基础研究创造了巨大机会窗口,研究者不应被当前状态吓倒。

Kaiser 用"技术只是当前阶段"反复解构悲观论:

"I think many people sometimes look at the current state of AI and get a little pessimistic. That it's like, you know, it's just big companies, big data centers, everything's so big and then you get a subscription to something you cannot do much about."
(我认为很多人看到 AI 的当前状态会有点悲观。就像,你知道的,只有大公司、大数据中心,一切都那么大,然后你只能订阅某样东西,却无能为力。)

但他立即反转:

"And to me, it's like, okay, but that's just the current state, you know? It's just this year next year. It's a step in the technology, but it's a step towards something much more fun where everyone can have their own model, maybe."
(对我来说,这只是当前状态,你懂的?只是今年明年而已。这是技术进程中的一步,但它是通向更有趣事物的一步——也许每个人都能拥有自己的模型。)

时代诊断:当大实验室因产品化、估值压力专注于 scaling 现有架构时(OpenAI "needs to do products"),基础研究的空白正在扩大。这为三类玩家创造机会:

  1. 开源运动:社区协作可弥补单点资源不足
  2. 学术界:大学仍有长期研究自由度
  3. 个人研究者:技术门槛已降至个人可及

乐观的未来图景

  • 多样性:"Maybe one will be making jokes this way in another way"(也许一个模型会这样讲笑话,另一个会那样讲)
  • 个性化:"Everyone can have their own model"(每个人都能拥有自己的模型)
  • 小数据学习:"Learn from much smaller data"(从更小的数据中学习)

最后以"笑话测试"收尾:当前 LLM 被问笑话总是相同回答("always the same"),但这会改变——因为这是架构产物,而"技术会改变,当研究赶上时"(technology will change when the research catches up)。

行动号召

"For researchers, there's like just huge opportunity to catch up with this. So you know, like, just don't worry about it... There is a thing ahead that we just need some research breakthroughs."
(对研究者来说,这是追赶的巨大机会。所以,你知道的,别担心……前方还有东西,我们只需要一些研究突破。)

元叙事:整个对话不是在否认当前困境,而是将其重新定义为"暂时的技术约束",并用具体证据(人类大脑、5090 算力、ensemble 研究)论证突破的可行性。悲观者看到集中化加剧,Kaiser 看到的是"研究者的巨大机会"——关键在于不把当前范式当作 AI 的本质。


人物与机构

  • Lukasz Kaiser:《Attention Is All You Need》论文共同作者,Transformer 架构核心设计者之一;曾在 Google Brain 和 OpenAI 工作,现独立研究。
  • Sophia Dew:a16z "MTS"(可能是 "Markets, Tech, and Society")节目主持人。
  • OpenAI:对话中作为"从研究实验室转向产品公司"的案例,暗示其基础研究投入下降。
  • 开源 AI Summit(旧金山):本次采访的录制地,象征开源社区对抗集中化的努力。

数字与证据

  • 时间节点:2024 年底至 2025 年初,编程代理(coding agents)开始真正可用,标志 AI 进入生产力替代阶段。
  • Transformer 年龄:"not even 10 years old"(2017 年论文发表,至今不到十年),强调当前范式远未成熟。
  • 硬件对比:单张 RTX 5090 GPU 算力 > 2017 年 Transformer 研究团队的 8 张 GPU 机器。
  • 成本门槛:训练前沿模型需要"数十亿美元"(billions of dollars)数据中心。

金句

  1. "We are the proof."
    (我们自己就是证明。)
    ——论证分布式、小数据学习的智能已在人类大脑中存在。

  2. "That's just the current state, you know? It's just this year, next year."
    (那只是当前状态,你懂的?只是今年、明年而已。)
    ——解构技术决定论,强调当前集中化的暂时性。

  3. "It got concentrated because that was a convenient thing to do."
    (之所以集中化,是因为那是方便的做法。)
    ——将集中化归因于工程便利性而非必然性。

  4. "Don't worry about [concentration]... there is a thing ahead that we just need some research breakthroughs."
    (别担心集中化……前方还有东西,我们只需要一些研究突破。)
    ——乐观主义的行动纲领。

  5. "It's a step in the technology, but it's a step towards something much more fun."
    (这是技术进程中的一步,但它是通向更有趣事物的一步。)
    ——将当前困境重新定义为通往更好未来的必经之路。


洞见与延伸背景

技术哲学:范式的暂时性

Kaiser 的核心方法论是 拒绝将当前技术状态本质化。Transformer 虽成功,但其"全网数据+规模扩张"范式可能只是"局部最优解"。历史类比:

  • 深度学习前的 AI 寒冬:符号主义、专家系统曾被认为是 AI 唯一路径,直到反向传播重新定义游戏规则。
  • ImageNet 时刻(2012):AlexNet 证明 CNN + GPU 可行,但 Transformer 在 2017 年再次改写架构。

每次范式转换都伴随"不可能"到"显而易见"的认知跃迁。Kaiser 暗示我们正处于下一次转换前夜。

经济学:Scaling Laws 的终结?

当前 AI 经济学基于 Scaling Laws(Kaplan et al., 2020):模型性能随参数量、数据量、计算量幂律增长。但这导致:

  • 边际成本递增:从 GPT-3(1750 亿参数)到 GPT-4(传闻 1.76 万亿参数),成本呈指数级上升。
  • 收益递减风险:Chinchilla 论文(2022)已指出很多模型"over-parametrized"(参数过多、数据不足)。

Kaiser 提出的"分布式专精模型"路径,本质上是 从 Scaling Laws 转向 Specialization Laws——不靠规模碾压,靠架构效率。

生物学启示:大脑的模块化

人类大脑约 860 亿神经元,但:

  • 功能分区:视觉皮层、语言区(Broca/Wernicke)、运动皮层等高度专精。
  • 小数据学习:儿童仅需数百个苹果样本即可泛化"苹果"概念,Transformer 需数百万张图。
  • 终身学习:人类可持续学习新领域而不"灾难性遗忘"(catastrophic forgetting),当前 LLM 做不到。

神经科学的 Mixture of Experts (MoE) 架构(如 GPT-4 传闻使用)已在尝试模拟这种模块化,但仍依赖全网预训练。真正突破可能需要 动态专精化:模型根据任务自主构建专用子网络。

社会学:权力的算法基础

AI 权力集中不仅是资本问题,更是 算法对资源的依赖程度 决定的:

  • Transformer 时代:算法 ∝ 数据 × 算力 × 资本 → 权力集中于科技巨头。
  • 假设的下一代:算法 ∝ 架构创新 × 专用数据 → 权力可分散至领域专家、开源社区、个人。

这解释了为何 Kaiser 强调"研究突破"而非政策监管——技术路径的改变可能比制度设计更根本地重塑权力格局。


争议与需核实

  1. "5090 RTX GPU 算力超过 2017 年 8 GPU 机器"

    • 待核实:2017 年 Google Brain 可能用 Nvidia P100/V100,单卡 FP32 约 10-15 TFLOPS;RTX 5090(假设存在)预估 FP32 约 80-100 TFLOPS,确实可能超过 8 张 P100。但具体数据需查证。
    • 潜在误导:算力提升不等于研究能力提升——训练大模型还需内存带宽、数据流水线等,单卡受限。
  2. "大实验室放弃基础研究"

    • 反例:OpenAI 仍在发表论文(如 o1 模型的思维链研究),Anthropic 的 Constitutional AI,DeepMind 的 AlphaFold/Gemini 系列均有基础研究成分。
    • 可能真相:基础研究占比下降,而非完全放弃;产品化压力确实挤压长期探索空间。
  3. "人类大脑的分布式类比"

    • 争议:大脑虽有功能分区,但仍是单一物理系统,与"分布式多模型"的网络架构有本质差异。
    • 更准确类比:大脑更像 动态路由的 MoE 系统,而非独立协作的多智能体。

行动建议

对个人研究者

  1. 硬件投资:如预算允许($2000-5000),购买高端消费级 GPU(如未来的 RTX 5090 或当前 4090)开始实验。
  2. 研究方向:聚焦 Transformer 的已知弱点:
    • 小数据学习:Few-shot learning、meta-learning 方向。
    • 专用领域适应:Parameter-efficient fine-tuning(LoRA、Adapter)。
    • 架构创新:State Space Models(如 Mamba)、Mixture of Experts 变体。
  3. 开源协作:加入 Hugging Face、EleutherAI 等社区,单点突破可通过社区放大。

对创业公司

  1. 赛道选择:避开"训练更大模型"的资本竞赛,转向:
    • 垂直领域模型:医疗、法律、金融等专用 AI,数据护城河 > 规模。
    • 推理优化:边缘设备部署、模型压缩、量化技术。
  2. 开源策略:发布专用模型/工具吸引社区,建立生态而非封闭优势。

对政策制定者

  1. 公共算力:建立国家级 AI 研究算力池,降低学术界/小团队门槛(参考欧盟 EuroHPC)。
  2. 数据治理:推动"数据最小化训练"研究,而非只监管数据使用——技术路径改变可从源头解决隐私问题。

来源

  • Episode 页面a16z.simplecast.com
  • 音频音频
  • 转写来源:whisper_base_from_rss_audio
  • 核心论文参考
    • Vaswani et al., "Attention Is All You Need" (2017) - Transformer 原始论文
    • Kaplan et al., "Scaling Laws for Neural Language Models" (2020) - Scaling Laws 理论基础
    • Hoffmann et al., "Training Compute-Optimal Large Language Models" (Chinchilla, 2022) - 挑战无限 scaling 范式

制作说明:本文基于 a16z Podcast 2026-09-07 期节目(时长 485 秒)英文转写制作,覆盖 00:00-07:01 全部实质内容。转写由 Whisper Base 模型生成,可能存在专有名词识别误差。