● Feed Monitor · 每天替你盯顶级英文播客

How Open Source Infrastructure Powers the AI Economy

a16z · 2026-08-07

How Open Source Infrastructure Powers the AI Economy
一句话摘要

vLLM 联合创始人 Simon Mo 与 a16z 合伙人 Matt 对谈:开源模型与闭源差距已不存在,Kimi K3 推理速度可达 500 tokens/秒,是闭源“快模式”的 2-3 倍。

开源AI推理引擎AI基础设施模型竞争
为什么值得看

开源模型真的只是闭源模型的廉价平替吗?vLLM 创始人 Simon Mo 和 a16z 合伙人 Matt 给出了一个反直觉的判断:能力上差距已经消失,真正的分水岭在于“控制权”——你能自己掌控推理速度、数据留存和内容安全。本期从技术细节到商业逻辑,讲透开源 AI 为何正在成为企业默认选择。

结构化解读
开源模型和闭源模型的差距,其实已经不存在了

Simon 直言,从能力上看,开源和闭源模型“今天就没有大差距”。模型的诞生要素——算力、数据、人才——全球流动,中国团队同样能做出顶尖模型。真正的差异不在模型本身,而在分发和市场策略。

  • Kimi K3 是典型案例:推理成本比 GPT-5 便宜,但比 GLM-5.2 贵,处于中间档位。它带来的不是“便宜”,而是“可拥有”——你能在自己基础设施上跑、微调、精确控制 token 消耗和性能。
  • 开源模型的“速度档位”碾压闭源:闭源模型只有“普通”和“快速”两档,但开源模型跑起来,服务商能提供 10 种不同速度。vLLM 的快速模式可达 400-500 tokens/秒,比闭源“快速模式”快 2-3 倍,对开发者体验是质变。
为什么企业宁愿花更多钱,也要用开源模型?

成本只是表象,控制权才是核心。Matt 观察到,约一年前,一批头部应用公司(Cursor、Decagon、Harvey)集体转向开源,因为闭源 API 无法提供定制所需的深度访问权限。

  • 控制权体现在三个层面:一是性能,语音 Agent 公司需要模型响应时间符合 SLA,只有自控模型能做到;二是数据,闭源模型没有零留存政策,数据必须留在供应商那里;三是安全,Anthropic 的模型会误杀合法研究,比如 vLLM 团队调试 GPU 内核时触发“红线”,两小时工作白费,只能改用 Kimi K3。
  • 开源模型的“维护”是全村任务:模型发布只是开始,社区要把它适配到各种硬件和场景——边缘设备、语音 Agent、编码 Agent。vLLM 支持超 1000 种模型架构,与英伟达、AMD、谷歌等硬件厂商深度合作,新芯片发布时甚至用 vLLM 做基准测试。
开源模型的商业模式,正在向制药业看齐

开源模型不是软件,训练一次要烧掉数亿美元,靠志愿者贡献时间根本玩不转。Simon 和 Matt 都认为,必须建立可持续的商业模式,否则中国模型实验室的资金来源会变成更糟糕的选项。

  • 许可证正在收紧:从 Apache 2.0 的“随便用”,到 Llama 的“月活超阈值需商业协议”,再到 MiniMax 和 Kimi 对衍生作品的限制。这不是贪婪,而是为了给下一轮训练融资。
  • 蒸馏不是中国模型的秘密武器:Simon 认为,当前进步的核心是“环境”而非“蒸馏”——Kimi K3 在 Arena 上最强的基准是前端编码,靠的是构建了极佳的自我迭代环境。环境无法被蒸馏,这是真正的护城河。
带走一句话

“开源模型的能力差距已经不存在了,真正的区别在于:你能拥有它,还是只能租用它。”

AI 视角启发
  • 评估模型时,别只看价格和跑分:把“能否在自己基础设施上运行”“能否精确控制推理速度”“数据是否留存”纳入选型标准,这些“控制权”指标对实际业务的影响往往大于基准测试分数。
  • 警惕闭源 API 的“误杀”风险:如果你的业务涉及敏感领域(如安全研究、政治话题翻译),闭源模型的内容审核可能随时打断工作流。提前评估备用的开源模型方案,避免关键任务被“红线”卡死。

↗ 观看原片(YouTube)

→ 看今天的全部更新每天替你盯 14 个顶级英文播客频道,AI 提炼成几分钟读完的中文精华。每日更新,无需登录。
微信扫一扫 / 长按识别

每天早上,这份精华我直接发你微信。加我,长按左边二维码。

微信:xiangcaizi02