● Feed Monitor · 每天替你盯顶级英文播客

Cooking with OpenAI’s Research Chief: AGI, o1, Evals, and Scaling Laws — Mark Chen

Latent Space · 2026-06-25

Cooking with OpenAI’s Research Chief: AGI, o1, Evals, and Scaling Laws — Mark Chen
一句话摘要

OpenAI首席研究官Mark Chen在烹饪对话中坦诚分享了公司内部如何通过“高风险赌注”和“研究品味”保持前沿,并直言“预训练已死”的观点是错的,同时揭示了AI研究正从“执行”转向“想法”的关键转变。

OpenAIAI研究预训练研究品味
为什么值得看

这期内容适合AI从业者、技术管理者以及对OpenAI内部运作好奇的人。值得花时间看,因为Mark Chen不仅回应了“预训练是否已死”等热门争议,还首次详细解释了OpenAI如何管理数百个研究项目、如何评估研究人才、以及为什么“研究品味”比学历更重要。最值得注意的冲突是:他承认模型在“主观领域”(如创意写作)仍难突破,但坚信通过RL和更好的评估体系,AGI的窗口正在快速关闭。

结构化解读
这期主要讲了什么

这是一场在烹饪韩国豆腐汤过程中进行的深度对话。Mark Chen以OpenAI首席研究官的身份,讨论了从研究人才选拔、内部项目管理、评估体系困境,到对AGI路径的判断等多个核心议题。整个对话轻松但信息密度极高,既有对“预训练已死”等流行论调的正面反驳,也有对“研究品味”如何培养的实操建议。

核心观点
  1. 预训练远未到天花板:Mark明确反对“预训练已死”的说法。他认为每次出现瓶颈,总会有新的工程或研究突破(如更好的数据工程、更精细的缩放)来解锁下一阶段。过去十年已验证了这一点,没有理由现在会停止。
  2. 研究品味可以后天培养:最好的方法是“复现”——找一篇你崇拜的论文,完全复现它的训练曲线和损失值。在这个过程中,你会学到论文里没写的隐性技巧。学历不是关键,创造性地解决问题的能力才是。
  3. RL在主观领域仍有硬伤:RL擅长有“冷硬真相”的领域(如数学、编程),但在创意写作等主观领域,因为无法客观评分,RL很难直接应用。这是当前AI能力“锯齿状边界”的根源之一。
  4. 评估体系正面临危机:大多数经典基准(如SAT)已被饱和,行业面临“评估危机”。OpenAI的做法是:让评估团队与模型优化团队分离,形成对抗性关系;同时积极与外部组织合作创建新评估。
  5. 研究管理的关键是“聚焦”:OpenAI内部每1-2个月会审查约300个项目,但高层研究路线图保持稳定。核心方法是:给少数大赌注(每个部门3-5个)分配大量算力,同时留出灵活算力池让管理者自主分配。
  6. “研究品味”是未来价值核心:随着模型越来越强,研究者的价值正从“执行”转向“提出好想法”。Mark认为,未来三年内,模型将能自主完成端到端研究,但“品味”——判断什么方向值得探索——仍是人类最后的壁垒。
最值得记住的一句话

“如果你还认为‘预训练已死’,那你低估了它;真正被低估的是:把研究原语连接到真实世界产品的能力。”

AI视角启发

对AI从业者而言,这期内容有几点直接启发:

  1. 不要被“预训练已死”的叙事带偏:如果你在做AI产品,应该继续押注基础模型的持续进化,而不是过早转向“小模型+微调”的路径。Mark的立场很明确:缩放定律还在起作用,只是需要更精细的工程。
  2. 评估体系是你的产品护城河:很多AI团队只关注模型能力,却忽视评估。Mark提到的“评估团队与模型团队分离”原则,可以直接应用到你的产品中——让测试团队独立于开发团队,避免“自我欺骗”。
  3. “研究品味”可以复制到产品决策:Mark建议通过“复现”来培养品味。对产品经理或AI应用开发者来说,这意味着:不要只看论文摘要,要亲手跑一遍、调一遍参数,才能真正理解技术边界。
  4. 高风险赌注是保持领先的关键:OpenAI愿意接受大量失败项目,只要偶尔有一个“超级成功”就值。这对创业公司同样适用——不要因为害怕失败而只做“安全”的选择,尤其是在技术快速迭代的领域。

↗ 观看原片(YouTube)

→ 看今天的全部更新每天替你盯 14 个顶级英文播客频道,AI 提炼成几分钟读完的中文精华。每日更新,无需登录。
微信扫一扫 / 长按识别

每天早上,这份精华我直接发你微信。加我,长按左边二维码。

微信:xiangcaizi02