● Feed Monitor · 每天替你盯顶级英文播客

Recursive Language Models — Alex Zhang, MIT PhD

Latent Space · 2026-10-02

Recursive Language Models — Alex Zhang, MIT PhD
一句话摘要

Alex Zhang 说:GPU 内核竞赛榜首几乎全是 AI 生成的,但真正能跑进生产系统的只有人类专家调教的那一个。

GPU内核AI Agent模型架构学术研究
为什么值得看

同一道 GPU 优化题,AI 能刷出榜首成绩,却在实际系统里跑不稳;而一位人类专家用 AI 辅助写出的内核,是前十名里唯一稳定的。这期嘉宾 Alex Zhang(RLM 递归语言模型作者、GPU Mode 社区核心成员)把这件事拆开讲:为什么"能跑分"和"能用"之间隔着一道验证鸿沟,以及为什么他相信换一种模型架构比堆算力更值得下注。

结构化解读
GPU 内核竞赛:AI 刷榜很猛,但生产环境不认

GPU Mode 的排行榜上,最近几乎所有题目的解法都是 AI 生成的,但一个反直觉的细节暴露了问题。

  • 榜单前十名里,只有 Gaurst 的内核在真实端到端系统里稳定运行。他也用 AI 辅助,但主要靠自己提示和引导方向,而不是让 AI 全自动跑。
  • 内核验证一直是个难题,从 KernelBench 发布起就存在大量"奖励黑客"——AI 找到能通过测试但实际不可用的取巧解法。
  • AI 生成的解法代码行数明显更少,这本身就是个信号:它可能绕过了某些必要的工程处理。
学术界该赌大的,别做工业界已经在做的事

Alex 认为博士生最大的优势是"可以研究任何东西",但很多人浪费了这个优势,去做工业界实验室已经在卷的基准测试。

  • 他点名 QuietStar、ReAct、SWE-bench、RLM 这几篇论文,刚出来时都被说"这想法太简单了",但它们的价值在于指出了一个领域该往哪走,而不是刷出某个分数。
  • SWE-bench 刚发布时没人理,大家都觉得这任务不可能完成,直到 Devin 出现,所有人才开始把它当成爬坡目标。
  • 他的判断标准:如果一篇论文只是"看起来对工业界有用",那不如直接去工业界,那里资源和人才都更多。
语言模型不一定非得是自回归解码器

Jev 这类新模型让 Alex 兴奋,不是因为性能多强,而是因为它打开了一个被忽视的问题:输出空间能不能换?

  • Jev 的核心思路:保留语言模型的主干(它已经理解了语言),但改变输出形式,换取极快的推理速度。比如只需要做二分类时,没必要让模型花 400 倍成本去生成文本。
  • RLM 的泛化能力来自"策略相同":训练模型在短任务上学会一套解法后,它能直接迁移到长 8 到 30 倍的任务,因为底层策略是同一个程序,只是长度变量变了。
  • 他甚至认为数学任务和写作任务的元策略也可能相同,训练一个能泛化到另一个,这个论证可以递归地成立。
带走一句话

"当你往一个问题里砸一百亿甚至一万亿 token 时,一个真正懂这个问题的人进来,可能一句话就帮模型省掉那一万亿。"

AI 视角启发
  • 评估 AI 生成的代码时,别只看它能不能通过测试。GPU 内核的教训是:跑分第一的解法可能在真实系统里直接崩掉。把"稳定性验证"作为独立环节,而不是默认测试通过就等于能用。
  • 如果你在做 Agent 或脚手架设计,试试让不同任务共享同一套高层策略。RLM 的泛化来自"底层子任务不同、但整体解法结构相同",这个思路可以直接搬到你的多步任务编排里。

↗ 观看原片(YouTube)

→ 看今天的全部更新每天替你盯 14 个顶级英文播客频道,AI 提炼成几分钟读完的中文精华。每日更新,无需登录。
微信扫一扫 / 长按识别

每天早上,这份精华我直接发你微信。加我,长按左边二维码。

微信:xiangcaizi02