What If We Stopped Using GPUs? | YC Paper Club
Y Combinator · 2026-10-04

斯坦福博士用无梯度优化器训练1B参数LSTM,发现模型分片越多效果越好;而光做前向传播几乎不耗电,两者结合可能绕开GPU能耗瓶颈。
GPU的每焦耳算力已经两年没涨,人脑却只用20瓦就能做语言和推理。这期三位讲者分别从光计算、神经形态芯片和无梯度优化器切入,给出绕开传统GPU路线的实验数据和工程细节,包括一个用光做扩散模型生成图像的完整系统。
光计算到底卡在哪,为什么现在突然有戏了
光子传输比电子损耗低一万倍、带宽大一万倍,但光计算一直没普及,卡点是数字和光之间的转换太贵。EPFL博士Ilker用光做扩散模型生成图像,能耗优势明显,前提是选对任务。
- 光做矩阵乘法的能耗和输入维度n成正比,电子是n²:光通过调制器加载输入,穿过固定的权重掩膜,探测器直接读出求和结果,全程被动、不额外耗能。
- Lightmatter的PCIe光计算板算力已对标GPU,但能耗大头不在光计算本身:DAC/ADC转换、参数校准、非线性激活这三项吃掉大部分预算,光计算只占小头。
- Ilker把扩散模型的1000步去噪切成10段,每段100步共用一组固定权重:这样不用在光域反复改写权重,10个器件轮流跑就能完成生成,MNIST和Fashion-MNIST上FID随参数增加按幂律下降。
神经形态计算:不是模仿大脑,是偷大脑的组织原则
Alok是斯坦福EE博士、Standard Ventures合伙人,管理15亿美元基金。他拆解脉冲神经元的工作机制后指出,神经形态计算真正的创新发生在数字硅上,而不是模拟电路。
- 脉冲神经元像一个漏电电容:输入脉冲累积电荷,超过阈值就发出一个离散脉冲,否则慢慢泄漏归零。脉冲的间隔和幅度都是连续变量,所以它既不像数字也不像模拟。
- 大脑的核心特征是记忆和计算交织在一起:突触连接本身既有权重又参与计算,而数字芯片里存储和计算是分开的,这是根本差异。
- 反向传播、Transformer注意力、大规模训练这些现代AI核心机制,没有一个是来自大脑的:Alok的原话是“我们已经跑偏了”,真正落地的神经形态创新都在数字硅上实现。
带走一句话
“如果这些方向都失败了,我的博士就毫无意义,我应该一直做反向传播才对。”
- 做推理优化的人,盯住“前向传播极便宜”的硬件形态:SPSA这类无梯度优化器只要前向传播,不用存激活值,天然适配光计算和模拟计算。一旦前向成本趋近于零,反向传播的统治地位就值得重新审视。
- 模型分片训练可能不只是工程妥协,而是统计优势:把数据集聚类后分给多个小专家模型,每个专家只需64次扰动就能收敛,且分片越多效果越好。这个结论若成立,对分布式训练和MoE架构都有直接参考价值。
