● Feed Monitor · 每天替你盯顶级英文播客

How Open Source Infrastructure Powers the AI Economy

a16z · 2026-08-07

How Open Source Infrastructure Powers the AI Economy
一句话摘要

vLLM 联合创始人 Simon Mo 与 a16z 合伙人 Matt 对谈:开源模型与闭源差距已不存在,Kimi K3 推理速度可达 500 tokens/秒,是闭源“快模式”的 2-3 倍。

开源AI推理引擎AI基础设施模型竞争
结构化解读

---

source_name: a16z

youtube_url: https://www.youtube.com/watch?v=78-6dUROziQ

---

开源模型真正争夺的,不只是便宜,而是你能不能把智能握在自己手里

Simon Mo 是 vLLM 的联合创始人和主要维护者之一。vLLM 是开源大模型推理引擎,负责把 GPU 变成可以稳定提供模型能力的服务;节目中提到,它已经运行在约 50 万张 GPU 上。另一位嘉宾 Matt Bornstein 是 a16z 合伙人,长期观察开源模型、基础设施和应用公司的变化。这期对谈真正要回答的不是“开源模型会不会追上闭源模型”,而是当模型越来越像基础设施时,谁拥有运行方式、数据和改造权。

这期回答了 7 个问题:

  1. 为什么大语言模型的推理服务不能直接沿用传统机器学习基础设施?
  2. vLLM 怎样从一个受欢迎的开源项目变成 AI 经济的关键基础设施?
  3. 为什么应用公司越来越需要开源模型,而不是只调用闭源 API?
  4. Kimi K3 这类开源权重模型带来的真正变化,是价格、速度还是控制权?
  5. 为什么模型发布之后,还需要一整个社区继续把它变成可用产品?
  6. “开放权重”为什么越来越需要新的商业和许可机制?
  7. 接下来开源模型的差异化,会从模型参数转向什么?
1. 大模型的瓶颈不是把答案算出来,而是把每个请求服务好

被问到为什么服务大语言模型和传统机器学习不同的时候,Simon 没有先谈模型能力,而是谈请求的混乱程度。传统分类任务的输入和输出相对固定;大语言模型的输入长度不同,输出长度不可预测,还要同时处理批量请求、排队、调度和显存占用。一个模型即使在实验环境里能跑起来,也不等于它能在真实产品里稳定接住成千上万次请求。

这也是 vLLM 的位置。Simon 把它称为推理引擎:“VLM is a inference engine.”(VLM 是一个推理引擎。)它的工作不是重新训练模型,而是把可用的 GPU 变成一个能对外提供智能的运行端点。速度、成本、可靠性和不同硬件的兼容性,都集中在这一层。

这意味着 AI 基础设施的价值不只在“模型有多聪明”。模型是原料,推理引擎像工厂里的生产线:同一个模型,如果排队和显存管理做得差,用户看到的就是慢、贵、偶尔失败;如果底层系统做得好,模型才有机会变成一个可持续使用的产品。模型能力的新闻通常发生在发布当天,真正决定它能不能进入日常工作的,是发布之后这一层工程。

2. 开源从爱好者项目变成关键基础设施,靠的是应用公司的依赖

被问到 vLLM 什么时候从“大家喜欢的开源项目”变成关键基础设施时,Matt 把时间点放在应用公司的架构选择上。早期的开源模型更像技术爱好者的实验品,很多人下载、试运行,但不一定把它放进业务。后来 Cursor、Decagon、Harvey 等公司开始发现,只靠闭源 API 很难建立自己的模型能力。

他们想做自己的中训练、后训练、推理和部署优化,而闭源厂商不会把这些访问权全部交出来。于是,开源模型不是被当成一个便宜替代品,而是被放进产品的核心路径。Matt 说:“open source became really central in a way that's not always visible”(开源以一种不太显眼的方式变成了核心。)用户可能只看到一个产品界面,背后却已经有开源权重、定制训练和自建推理服务。

这改变了“开源是否成功”的判断方式。不能只看有多少人下载模型,也不能只看模型在公开榜单上的排名。更重要的问题是:有没有公司愿意把关键业务压在这套软件上,有没有团队愿意围绕它长期修 bug、做兼容和优化。一旦应用公司的生存依赖它,开源项目就从社区作品变成了生产基础设施。

3. vLLM 的位置,是让模型和硬件在发布当天接上

被问到 vLLM 在技术栈中的具体位置时,Simon 说它支持超过 1,000 种模型架构,而且会和 Nvidia、AMD、Google、Amazon、Intel 等硬件厂商配合。模型实验室负责训练模型,硬件厂商提供芯片,Hugging Face 负责模型格式和分发,而 vLLM 负责让模型真正跑起来。

这个过程不是模型实验室单方面发布文件那么简单。一次模型发布通常要同时牵涉模型团队、硬件供应商、推理引擎、模型仓库、云服务商和一批部署伙伴。Simon 讲到,早期有些模型只是丢出一个下载链接,用户拿到文件后还要自己解决如何运行;现在更成熟的发布,会在模型上线前就把这些合作方组织起来。

他把这件事描述成模型“遇到世界”的位置。模型论文和权重文件只代表训练结果,用户能否在不同硬件、不同集群和不同场景里使用它,才代表发布真正完成。对一个模型实验室来说,推理引擎不是发布后的附属工具,而是把研究成果送进真实世界的最后一段路。

4. 开源权重的优势,是同时控制成本、速度和数据边界

被问到客户为什么愿意使用开源权重模型时,讨论从价格转向控制。过去几年,控制权一直是主要原因:企业想知道模型运行在哪里、数据是否被保存、系统何时会改变。最近成本压力变强,尤其是开发者使用高价编码计划、长任务和大量 token 时,账单可能迅速失控。但成本和控制并不是两个独立的卖点,控制基础设施本身就是控制成本的一部分。

一个语音 Agent 需要在固定时间内回应用户,就不能只依赖一个随时可能调整速度或限流的外部 API。企业还可能需要自己的安全策略、数据保留规则和合规边界。开源权重允许团队在自己的硬件上运行、微调模型,并明确测量每个任务需要多少 token、多少显存和多少时间。

Kimi K3 的例子把这种差异说得很具体。它在某些配置下可以达到每秒 400 到 500 个 token,比闭源模型的快速模式还快两到三倍;更重要的是,开放权重让不同服务商可以提供多档速度和价格,而不只是一个“普通模式”和一个“快速模式”。这意味着模型不再只是一个统一的订阅按钮,而是一套可以按任务调节的基础能力。

这也解释了为什么开源模型未必总是最便宜。即使某个模型的运行成本接近闭源模型,企业仍可能选择它,因为自己拥有数据边界、性能曲线和改造空间。省钱只是第一层价值,知道自己正在为什么付钱,才是更长期的价值。

5. 模型发布不是终点,真正的开源工作发生在发布之后

被问到模型发布之后还需要维护什么时,嘉宾先拆掉了一个误解:训练完成不代表模型已经准备好服务所有人。模型可能是在一种硬件架构上训练的,但用户会拿不同的 GPU、不同的集群拓扑、不同的上下文长度和不同的业务请求来运行它。

因此,发布之后会出现一整套社区工作:有人把它适配到边缘设备,有人把它优化到最大规模,有人针对语音 Agent 调参,有人针对编码 Agent 修正延迟,还有人负责找出极低概率才出现的 bug。Simon 说,模型发布后要把一个人的使用场景扩展成几乎无穷多个场景,这是一整个村庄的工作。

这个过程和开源软件维护很像,但规模更昂贵。开源软件可以靠开发者在业余时间提交代码;训练前沿模型却需要巨额算力,背后可能经历多次失败的训练任务。模型最终公开时,外界只看到一次成功的运行,没看到前面那些集群故障、损失异常和重新训练。

这意味着“开放”不等于“免费帮你做好”。开源社区把改进能力分散给更多人,但每个使用者也要承担一部分适配和验证责任。谁想把模型放进关键业务,谁就需要建立自己的测试、监控和回滚能力,不能把开源两个字当成供应商责任的自动转移。

6. 开放权重需要商业机制,因为前沿训练不能靠热情支付

被问到为什么最近的开放模型开始出现更复杂的许可条款时,Matt 先区分了开源软件和 AI 模型。Apache 2 这样的软件许可可以让别人修改和再分发,但前沿模型的训练需要大规模数据、研究人员和昂贵的计算资源。一个团队不能像维护普通软件那样,晚上回家后和朋友一起训练一个前沿模型。

因此,一些模型实验室开始对商业规模、衍生作品或特定使用方式设置条件。嘉宾认为这不一定是贪婪,而是试图给下一轮训练建立资金来源。Simon 用药物研发做类比:新药研发需要长期投入,药物上市后的收入又会回流到下一轮研发;模型也需要某种机制,让巨额训练成本不至于只靠一次融资或少数公司的补贴。

这带来一个必须说清楚的边界:很多人把“开源模型”说成了“开放权重模型”。软件源码、训练数据、模型权重、推理工具和商业许可并不是同一件事。一个模型可以公开权重,却限制商业使用;也可以开放推理代码,却不开放训练过程。企业在选型时如果只看“open”这个标签,后面很容易在授权、数据和部署上踩坑。

这意味着开源生态的下一步不是简单回到“所有东西都免费”。更现实的方向是:哪些层应该开放,哪些服务可以收费,模型实验室怎样获得持续收入,用户又怎样保留足够的改造和迁移权。开放的价值需要经济机制承接,否则最昂贵的那一层最终还是会重新集中到少数组织手里。

7. 下一轮差异化不在有没有模型,而在谁能造出更好的学习环境

被问到五年后开放模型和前沿闭源模型的差距时,Simon 认为能力差距即使现在也没有外界想象得那么大。真正重要的差异,越来越来自数据、环境和让模型持续改进的方法。

他以 Kimi K3 的前端编码能力为例。模型不只是被喂进一批训练数据,而是在一个能看到渲染结果、继续修改、再循环的环境里学习。这个环境让模型知道自己的代码是否真正产生了可见结果,也让训练从一次性生成变成连续反馈。

Simon 说:“the next year is all going to be about that”(接下来一年都会围绕这件事展开。)这里的“那件事”不是单纯扩大参数,而是寻找更好的环境、更有效的算法选择,以及让模型在环境中继续变强的训练方法。开放权重模型的竞争,会从谁拿到了更多数据,转向谁更能把模型放进真实任务里学习。

这也让“蒸馏”不再是唯一解释。嘉宾认为,别人的交互数据可以被改写或学习,但一个模型在真实环境里怎样试错、观察结果、调整策略,这个过程不容易直接复制。很多能力来自构造环境和理解学习过程,而不只是复制答案。

把这 7 条放在一起看

这期对谈的主线,是 AI 正在从“调用一个模型”变成“拥有一套智能基础设施”。模型能力只是其中一层,vLLM 这样的推理引擎负责把它稳定地送到硬件上,开放权重让企业控制数据、速度和改造,社区再把一次发布扩展成无数真实场景。

所以,开源和闭源的竞争不能只问谁的榜单分数更高。还要问谁能让模型更快进入生产,谁能把成本和数据边界说清楚,谁能让开发者在出现误判或限制时保住工作流,以及谁拥有能让模型持续学习的环境。对做 AI 产品的人,最值得带走的不是“选开源还是闭源”这句结论,而是把模型、推理、数据、上下文和学习反馈拆开评估。真正的控制权,往往不在模型名字上,而在你能不能替换它、测量它,并让系统在自己的场景里越用越好。

↗ 观看原片(YouTube)

→ 看今天的全部更新每天替你盯 14 个顶级英文播客频道,AI 提炼成几分钟读完的中文精华。每日更新,无需登录。
微信扫一扫 / 长按识别

每天早上,这份精华我直接发你微信。加我,长按左边二维码。

微信:xiangcaizi02