● Feed Monitor · 每天替你盯顶级英文播客

🔬 The Bitter Lesson is Coming for Proteins - Alex Rives, BioHub

Latent Space · 2026-05-27

🔬 The Bitter Lesson is Coming for Proteins - Alex Rives, BioHub
一句话摘要

ESMC 证明了蛋白质语言模型可以通过纯粹缩放数据和模型规模,无需复杂的先验知识或多序列比对,就能涌现出对蛋白质结构、功能和进化的深刻理解,并直接用于设计具有治疗潜力的抗体,这标志着 AI 驱动的生物学研究进入了一个新的范式。

蛋白质语言模型AI for Science抗体设计虚拟细胞
为什么值得看

这期内容适合所有关注 AI 在生命科学领域应用的从业者、投资者和研究者,尤其适合那些对“大模型+生物学”交叉方向感兴趣的人。值得花时间看的原因是,嘉宾 Alex Rives(Biohub 科学负责人)是 ESM 系列模型的核心创造者,他不仅分享了 ESMC 模型的最新突破——如何通过加入宏基因组数据打破缩放定律的瓶颈,还首次展示了如何利用这个“世界模型”直接搜索并设计出具有治疗级亲和力的抗体(SCFVs),这在以往是极具挑战的。最值得注意的冲突在于,他坚定地站在“苦涩教训”一边,认为纯粹的数据和算力缩放就能解决复杂的生物学问题,这与 AlphaFold 等依赖大量先验知识(如 MSA)的方法形成了鲜明对比。他的观点是,生物学数据的“上下文”本身就蕴含了所有规律,模型只需要足够大、数据足够多,就能自己“学会”这些规律。

结构化解读
这期主要讲了什么

这期播客深入探讨了蛋白质语言模型 ESM 系列的最新进展,特别是第四代模型 ESMC 及其衍生模型 ESM Fold 2。嘉宾 Alex Rives 详细解释了 ESMC 的核心哲学:通过训练一个巨大的语言模型来预测“进化会选择哪个氨基酸”,从而让模型自己学习蛋白质的结构、功能和进化规律。他对比了 ESMC 与之前模型(如 ESM2)的关键区别——加入了海量、嘈杂的宏基因组数据,这打破了之前模型在缩放上的收益递减,展现出清晰的缩放定律。更重要的是,他介绍了如何利用 ESMC 构建的“世界模型”进行蛋白质设计,特别是成功设计出单链抗体(SCFVs),并讨论了这一成果对药物开发的潜在影响。最后,他展望了 Biohub 的愿景:构建一个由 AI、前沿实验技术和数据反馈循环驱动的“虚拟细胞”,以加速对生命本质的理解和疾病防治。

核心观点
  1. 蛋白质语言模型的“苦涩教训”正在被验证:Alex 坚信缩放定律在蛋白质领域同样有效。他认为,只要模型足够大、训练数据足够多(尤其是覆盖更多进化上下文的宏基因组数据),模型就能自动涌现出对蛋白质结构、功能和进化的深刻理解,无需人工设计复杂的先验知识或归纳偏置。ESMC 的成功证明了这一点。
  2. 数据质量的关键在于“上下文多样性”而非“纯净度”:传统的生物学数据收集(如 UniRef)追求高质量、注释清晰的序列。但 Alex 认为,对于训练通用蛋白质模型,更重要的是让模型看到氨基酸在尽可能多的、不同的进化环境中出现。宏基因组数据虽然嘈杂、不完整,但提供了前所未有的进化上下文多样性,这正是 ESMC 性能飞跃的关键。
  3. 无需 MSA 的结构预测是重大突破:ESM Fold 2 不依赖多序列比对(MSA)就能达到甚至超越 AlphaFold 3 的结构预测精度,尤其是在抗体等难以通过 MSA 获得有效进化信息的蛋白上表现更优。这意味着模型已经内化了进化信息,可以处理“孤儿”蛋白或快速进化的蛋白,极大地扩展了结构预测的适用范围。
  4. 蛋白质设计从“工程”走向“搜索”:ESMC 的设计思路不是从头“构建”一个蛋白质,而是在其学习到的“世界模型”中进行搜索,找到满足特定设计标准(如结合特定靶点)的天然或类天然蛋白质序列。这种方法成功设计出了具有治疗级亲和力的单链抗体,证明了其强大的实用潜力。
  5. AI 驱动的生物学研究新范式:Alex 描绘了一个由三大支柱构成的未来:① 大规模、高通量的实验数据生成;② 能够预测分子、细胞乃至生理过程的数字孪生模型;③ 一个智能的、可扩展的推理与反馈循环(类似 RLVR),让 AI 模型能自主提出假设、设计实验、分析结果并更新自身知识。Biohub 的目标就是构建实现这一范式的科学机构。
最值得记住的一句话

“我们不是在设计蛋白质,我们是在搜索进化已经写好的答案。”

AI 视角启发

对于 AI 从业者,尤其是做基础模型和 AI for Science 的团队,这期内容有几点非常具体的启发:

  1. “数据质量”的重新定义:在 NLP 和 CV 领域,我们追求高质量、干净、标注好的数据。但在蛋白质领域,Alex 的实践告诉我们,对于某些任务,“上下文多样性”可能比“数据纯净度”更重要。这启发我们思考:在构建其他科学领域的通用模型时,是否也应该优先考虑数据的“广度”和“多样性”,而非仅仅追求“精度”?比如,在材料科学中,是否应该更多地纳入各种极端条件下的、甚至是不完整的实验数据?
  2. “世界模型”作为设计工具:ESMC 的设计方法(搜索世界模型)与当前流行的“生成式设计”(如扩散模型)思路不同。它更像是一个强大的检索和优化引擎。这提示我们,对于某些高度复杂、约束众多的领域(如药物分子设计、材料配方设计),一个足够强大的、能够模拟真实物理/化学规律的“世界模型”,可能比一个纯粹的生成模型更有效、更可控。我们可以思考如何将这种“搜索+优化”的范式应用到自己的领域。
  3. 从“预测”到“发现”的范式迁移:Alex 提到的“虚拟细胞”和“推理反馈循环”,本质上是将 AI 从一个“预测工具”升级为一个“科学发现引擎”。这对 AI 产品经理和研究者来说是一个重要的方向:我们不应该只满足于让 AI 回答“是什么”或“会怎样”,而应该思考如何构建一个系统,让 AI 能主动提出“为什么”和“如果……会怎样”,并自主设计实验来验证。这需要将 AI 模型与实验自动化平台(如 Biohub 正在构建的)深度耦合。

↗ 观看原片(YouTube)

→ 看今天的全部更新每天替你盯 14 个顶级英文播客频道,AI 提炼成几分钟读完的中文精华。每日更新,无需登录。
微信扫一扫 / 长按识别

每天早上,这份精华我直接发你微信。加我,长按左边二维码。

微信:xiangcaizi02