Why AI Labs With Unlimited GPUs Still Fail — Anjney Midha, AMP
Latent Space · 2026-06-18

AI 基础设施的瓶颈不在算力或资金,而在于组织文化、激励机制和系统对齐的缺失——这是 Andreessen Horowitz 合伙人兼 Amp 创始人 Anshuman 的核心判断,他主张用“输出最大化”和“独立系统运营商”的思维来重构整个 AI 供应链。
这期内容适合所有关注 AI 基础设施、算力调度、以及大型组织如何有效运作的人。Anshuman 作为顶级 VC 和 AI 基础设施公司 Amp 的创始人,提供了罕见的双重视角:既能看到资本层面的宏观博弈,又能深入到技术细节(如节点利用率、MFU、调度系统)。最值得注意的冲突在于:他尖锐地指出,许多 AI 实验室拥有无限资金和算力,却依然无法交付产品,根源是“文化”和“对齐”问题,而非技术问题。他提出的“输出最大化”哲学和对“独立系统运营商”的类比,为理解当前 AI 供应链的混乱提供了全新框架。
这期播客深入探讨了 AI 基础设施的现状与瓶颈。Anshuman 从两个看似不相关但实则紧密相连的问题切入:一是 AI 算力集群的惊人浪费(节点利用率远低于 Google 内部 95% 的标准,MFU 利用率仅在 60-70%),二是美国医疗系统中临终关怀的巨额浪费(占 Medicare/Medicaid 支出的 30% 以上)。他认为,这两个问题的根源都是“对齐”失败——组织内部、供应链上下游、甚至社会与科技之间的激励不匹配。他由此引出自己创立的 Amp 公司,其愿景是成为算力领域的“独立系统运营商”(ISO),像电网一样将分散的算力池化、调度,实现“输出最大化”。他还分享了自己从斯坦福生物信息学研究生到 VC 再到基础设施创业者的心路历程,并探讨了如何通过文化、信任和系统设计来解决 AI 领域的根本性挑战。
- AI 基础设施的最大问题是文化,而非技术或资金。 许多 AI 实验室拥有充足的现金和算力,却无法交付产品,根本原因在于组织文化。当团队不再通过具体行动来证明其使命与承诺的一致性时,文化就会开始瓦解。这种“对齐”的缺失,比任何技术瓶颈都更具破坏性。
- 算力浪费是系统性的,源于“对齐”的偏差。 从资本投入、集群部署到最终产出,供应链中每增加一层抽象和分离,都会引入“角度偏差”。在快速扩张的压力下,这种偏差会像弧线一样被放大,导致浪费指数级增长。解决方案是“迭代式上线”,而非“一次性大规模部署”。
- “这次不一样”不适用于基础设施。 虽然 AI 能力是全新的,但这不能成为忽视基础设施常识的借口。相反,AI 的高成本和高风险,更应该让“常识”和“负责任的基础设施”成为优先项。Zuckerberg 从“快速行动,打破常规”到“更快的稳定基础设施”的转变,是行业成熟度的标志。
- 解决社区对数据中心的抵触,需要创造“净正面”价值。 高达 20% 的美国数据中心项目面临社区反对风险。Anshuman 提出一个大胆设想:将算力每小时成本提高 50 美分,直接返还给当地社区(如降低电费),从而将社区从反对者转变为合作伙伴。这不仅是公关策略,更是确保算力供应长期可靠的必要条件。
- Amp 的定位是算力领域的“独立系统运营商”(ISO),而非“全栈整合者”。 与 OpenAI、xAI 等垂直整合模式不同,Amp 选择水平化、多云、多芯片的路线,旨在将算力像电力一样池化和调度。其核心是建立一个中立的协调机制,让不同需求模式(如基础负载与突发峰值)的客户共享算力,从而提升整体利用率。
- “输出最大化”是核心工程哲学。 无论是算力调度、组织管理还是医疗系统,核心目标都应是“用现有资源产出最大价值”。这要求反对浪费,追求最优解,而非简单地堆砌资源。Anthropic 的成功部分归功于其专注于 Transformer 架构,避免了早期投资分散。
- 信任边界是芯片创业公司的最大瓶颈。 像 Matrox 这样的新芯片公司,通过采用 Nvidia 参考架构来避免在数据中心设计上“四面树敌”,但最大的挑战是失去了像在 Google 内部那样与模型团队紧密协同设计的“信任边界”。Amp 这样的独立平台可以帮助这些芯片公司重新获得这种信任和可见性。
- 优秀的科学家往往也是优秀的 CEO。 在顶尖学术领域取得成就的科学家,已经证明了其作为“思维运动员”的卓越领导力、抗压能力和资源获取能力。他们成为 CEO 的失败模式通常不是能力不足,而是“不想当 CEO”,只想继续做研究。
“AI scaling doesn't change the value of common sense in infrastructure. If anything, it should put a premium on it, because the margin of error is now so much lower and the cost of wastage is so much higher.”(AI 的规模化并没有改变基础设施中常识的价值。相反,它应该让常识更受重视,因为现在的容错率更低,浪费的代价更高。)
这期内容对 AI 从业者,尤其是做基础设施、平台或大型模型训练的团队,有几点非常具体的启发:
- 警惕“算力幻觉”:很多团队以为拿到 GPU 就万事大吉,但 Anshuman 的数据(节点利用率远低于 95%)说明,算力到手和算力被有效利用是两回事。做 AI 产品时,不仅要考虑“买卡”,更要考虑“用卡”的效率。这直接关系到成本和迭代速度。如果你的团队在抱怨算力不够,先检查一下现有集群的 MFU 和节点利用率,可能问题出在调度和软件栈上。
- “对齐”是比“架构”更难的技术问题:Anshuman 反复强调的“对齐”,在 AI 产品语境下,就是“让团队、资本、基础设施和最终目标保持一致”。对于 AI 创业公司,这意味着:你的融资节奏、技术选型、团队文化、产品目标,是否形成了一个紧密的、低损耗的反馈闭环?任何一环的脱节(比如拿了太多钱但团队文化跟不上,或者技术路线与市场需求不匹配),都会导致巨大的浪费。这比选哪个模型架构更重要。
- 做“平台”还是做“应用”?参考“独立系统运营商”模式:对于想做 AI 基础设施或平台的公司,Amp 的“ISO”模式是一个值得深思的参考。它不直接拥有资产(算力),而是通过中立的调度和协调来创造价值。这启示我们:在 AI 生态中,解决“信任”和“协调”问题的平台,可能比直接提供算力或模型的公司更具长期价值。例如,做模型评估、数据标注、算力期货交易、跨模型编排等,都是在扮演“ISO”的角色。
- “输出最大化”是衡量一切工作的标尺:这个哲学可以应用到日常工作中。当你面临技术选型、团队分工、资源分配时,问自己:“这样做是否能最大化我们团队的‘输出’?” 这能帮你避免陷入“为了用新技术而用新技术”或“为了堆砌指标而堆砌算力”的陷阱。它迫使你关注最终结果,而非中间过程。
