🔬 "The Most Innovative Diffusion Research Is Happening in Drug Discovery, Not Image Generation"
Latent Space · 2026-06-30

本期节目揭示了AI在药物发现领域的真实进展:通过将LLM的预训练、后训练和推理时扩展策略迁移到蛋白质-小分子结构预测,并融合物理先验知识,Genesis团队成功突破了传统方法在“不可成药靶点”上的瓶颈,证明了AI在药物发现中的价值并非“一步到位”,而是通过持续迭代和工程化落地实现的。
这期内容特别适合AI从业者、生物科技投资者以及对AI在物理世界应用感兴趣的人。值得花时间看的原因是,它打破了“AlphaFold解决药物发现”的流行误解,深入探讨了为什么静态结构预测不够,以及如何通过合成数据、物理先验和推理时扩展来真正提升模型在药物设计中的实用性。最值得注意的冲突在于:尽管公众认为AI已“解决”蛋白质折叠,但实际药物发现中,模型需要达到1埃级别的精度才能被下游物理工具使用,而大多数公开模型仍停留在模糊预测阶段。Genesis通过将LLM扩展策略与物理模拟结合,展示了如何将AI从“模式匹配”推向“可泛化预测”。
本期播客以Genesis Molecular AI的创始人Evan Fineberg和CTO Sergey Udov(前Llama 2/3预训练负责人)为主角,深入探讨了AI在药物发现中的实际应用。对话从AI在蛋白质-小分子相互作用预测的历史困境开始,回顾了从GAN到扩散模型的技术演进,并重点介绍了Genesis的核心模型“Pearl”——一个专门针对小分子-蛋白质复合物结构预测的扩散模型。节目详细解释了为什么传统机器学习方法在药物发现中效果有限(如数据稀缺、泛化能力差),以及Genesis如何通过合成数据生成、物理先验注入和推理时扩展(类似LLM的“思考令牌”)来突破这些限制。最后,讨论延伸到药物发现的全流程,包括ADMET性质预测、与大型药企的合作模式,以及AI在“不可成药靶点”上的实际价值。
- AI药物发现没有“iPhone时刻”:与公众认知不同,AI在药物发现中的进步是渐进的,类似于自动驾驶的迭代发展。每个阶段的技术(如GAN、扩散模型)都解决了特定问题,但需要持续改进才能产生实际价值。
- 蛋白质-小分子相互作用预测的瓶颈在于数据稀缺和泛化能力:公共数据库(如PDB)仅有约20万个晶体结构,且扩展缓慢。传统ML模型容易过拟合到已知数据,无法泛化到新靶点。Genesis通过物理模拟生成合成数据来弥补这一缺陷。
- 1埃精度阈值是关键:对于药物设计,结构预测必须达到1埃级别的精度,否则下游的物理模拟(如分子动力学)会因错误累积而失效。例如,2埃的误差可能导致芳香环翻转,使整个结合模式错误。
- LLM扩展策略可迁移到结构预测:Genesis借鉴了LLM的预训练、后训练和推理时扩展三阶段策略。预训练阶段使用合成数据;推理时扩展通过扩散模型的迭代过程,结合物理验证来“思考”更好的结构,显著提升性能。
- 静态结构不够,需要动态和性质预测:仅仅预测一个静态的蛋白质-配体复合物结构不足以设计药物。还需要预测ADMET性质(吸收、分布、代谢、排泄、毒性)、溶解度、选择性等,这些才是决定药物能否进入临床的关键。
- “不可成药靶点”是AI的高杠杆应用点:许多疾病靶点生物学清晰,但传统方法无法找到有效分子。AI通过更精确的结构预测和性质优化,可以打开这些“难成药”空间,创造巨大临床价值。
- 模型输出必须与物理工具兼容:Genesis强调其模型输出的3D坐标可以直接作为分子动力学等物理模拟的输入,确保AI预测能被传统计算化学社区验证和使用,避免“黑箱”幻觉。
“AI在药物发现中的价值不是‘一步到位’的奇迹,而是通过将LLM的扩展策略与物理先验结合,让模型学会‘思考’结构,从而在每一个迭代中逼近真实。”
这期内容对AI从业者(尤其是做LLM、扩散模型或AI for Science的团队)有非常具体的启发:
- “合成数据”是突破数据瓶颈的关键:在缺乏互联网级数据的领域(如蛋白质结构),不能只依赖公开数据集。Genesis的做法是:用物理模拟(如分子动力学)生成大量合成数据,然后训练模型。这类似于LLM中“蒸馏”或“自生成数据”的思路——先有一个弱但物理正确的模拟器,再用它生成训练数据来提升模型。对于任何需要物理真实性的AI应用(如材料设计、机器人控制),这都是一条可复用的路径。
- “推理时扩展”不仅适用于语言:Genesis在扩散模型中引入类似LLM“思考令牌”的机制——模型在生成结构时,不是一步到位,而是通过多步迭代,每一步都结合物理验证来修正输出。这本质上是一种“推理时计算”的扩展,类似于AlphaGo的蒙特卡洛树搜索。对于AI for Science领域,这意味着:不要只追求模型参数量,还可以在推理阶段投入更多计算资源来提升精度,尤其是当你有可靠的验证器(如物理模拟)时。
- 物理先验是防止“幻觉”的锚点:LLM容易产生幻觉,而结构预测模型同样会“生成”看似合理但实际错误的结合模式。Genesis的做法是:在模型架构中注入物理先验(如键长、键角约束),并在输出阶段用物理模拟验证。这给AI产品设计的启示是:对于高风险领域(如医疗、工程),不能只依赖数据驱动的模式匹配,必须引入领域知识作为“护栏”,确保模型输出在物理上可行。
- 从“模式匹配”到“泛化预测”的跃迁:Evan指出,传统ML擅长模式匹配(即告诉模型它已经见过的东西),但药物发现需要泛化到全新靶点。Genesis通过合成数据+物理先验+推理时扩展,实现了这种跃迁。这对所有AI从业者的启示是:如果你的模型在测试集上表现良好,但在真实世界中失效,问题可能不是模型不够大,而是训练数据分布与真实分布存在偏差。解决方法是:要么扩大数据覆盖(如合成数据),要么引入更强的归纳偏置(如物理定律)。
