Faster Chips That Don't Melt — Anima Anandkumar & Benedikt Jenik, Accelerated Understanding
Latent Space · 2026-09-05

Anima 和 Benedict 的 Accelerated Understanding 用 4D 时空训练万亿参数物理模型,上下文长度达 5 万亿,远超语言模型。
Anima 刚入选《时代》AI 百大影响力人物,其公司 Accelerated Understanding 也刚结束隐身。他们声称已训练出上下文长度达 5 万亿的物理模型,并发现多物理领域联合训练优于单领域。这期播客首次公开了背后的架构、数据和 Scaling 细节。
物理世界的“GPT 时刻”:把不同物理领域塞进同一个模型
Anima 和 Benedict 的赌注是:语言模型大一统的成功,在物理世界同样适用。他们不训练“天气预报模型”或“心脏导管模型”,而是训练一个通用的物理模型,让流体、半导体、能源等不同领域共享底层规律。
- 多物理联合训练有奇效:他们发现,把多个物理领域放进同一个模型,比把全部参数给单个领域训练出的专用模型效果更好。这说明模型学到了跨领域的共享特征,比如能量守恒和因果关系,而非简单的参数堆砌。
- 物理定律是“数据”也是“老师”:纯数据驱动不够,因为科学发现本质是创造训练数据里不存在的新东西。他们的解法是用 PDE(偏微分方程)生成训练数据,同时把 PDE 本身作为训练信号,让模型自我改进,突破训练数据的质量上限。
5 万亿上下文是怎么炼成的:4D 数据与自研基础设施
物理模拟的数据和语言完全不同,它是在三维空间加一维时间上展开的,数据量巨大。为了不丢失细节,他们不走视频模型压缩分辨率的“捷径”,而是直接处理完整的 4D 数据,这逼着他们重写了整个训练基础设施。
- 数据是 4D 的,上下文轻松破万亿:一个 1000×1000×1000 的空间网格,加上 1000 个时间步,就是一万亿个数据点。他们训练时用万亿级上下文,推理时可达 5 万亿,单次输出就有 22TB,必须用超大集群和高带宽互联才能喂给 GPU。
- 不用 Transformer,用神经算子:Transformer 的注意力机制是平方级复杂度,无法处理 5 万亿上下文。他们改用神经算子作为架构基础,因为它能做到“分辨率不变”,训练和推理时可以根据任务难度灵活调整上下文长度,而不是像视频模型那样锁死分辨率。
先啃半导体和能源,靠“课程工程”造数据
他们的商业化路径很清晰:先做半导体和能源。这两个领域对物理模拟的需求最迫切,且他们能用“课程工程”自己生成训练数据,绕开真实物理数据稀缺的瓶颈。
- 半导体不只是做数字设计:传统芯片设计是“数字先行,物理后验”,物理检查只是走个过场。他们想用物理模拟在芯片设计早期就介入,利用物理规律把性能“压榨”到极限,而不是只求“能跑通”。
- 用模拟器自建“课程”:与语言模型“投喂整个互联网”不同,他们用数值模拟器按需生成数据,从简单方程和低分辨率开始,像上课一样循序渐进地训练模型,这比无序的真实数据更高效。
带走一句话
“我们观察到,在窄领域模型和通用模型之间,通用模型的表现全面胜出。”
- 评估物理 AI 公司时,别只看 Demo,要问它的训练数据从哪来。能用模拟器自建“课程”并闭环自我改进的,比依赖稀缺真实数据的公司更有壁垒。
- “多任务联合训练优于单任务”在物理世界同样成立。设计 AI 产品时,可以主动把多个相关但不同的任务放进同一个模型,利用共享的底层规律提升整体表现。
