Why Traditional Benchmarks Fail Modern AI Models with OpenAI Research Scientist Noam Brown
No Priors: AI, Machine Learning, Tech, & Startups · 2026-06-26

AI 模型的能力已不再是一个固定值,而是你愿意投入多少推理预算的函数,但整个行业的安全评估和基准测试体系还停留在“只看模型不看预算”的旧时代,这导致我们既高估了某些模型、又低估了另一些模型的真实潜力。
这期内容适合所有关注大模型前沿能力、模型评估方法论、以及AI安全政策的从业者、研究者和产品经理。值得花时间看的原因是:OpenAI推理团队的核心成员Noam Brown(推理时间缩放定律的先驱)直接点破了当前行业在模型评估上的一个系统性盲区——几乎所有公开的基准测试和内部安全评估都忽略了“测试时计算预算”这个关键变量。最值得注意的冲突在于:模型能力已经从一个静态属性变成了一个随推理预算动态变化的函数,但整个行业的评估框架(包括负责任扩展政策)还停留在GPT-3时代,用静态指标去衡量动态能力,这导致我们既无法准确判断模型的真实上限,也无法有效评估其安全风险。
这期播客的核心议题是:随着推理时间缩放定律(Test-Time Compute Scaling)成为现实,AI模型的能力已经不再是一个固定值,而是你愿意投入多少推理预算(时间、Token、金钱)的函数。Noam Brown以OpenAI o1系列(文中提到的5.2、5.4、5.5等内部版本)为例,解释了为什么传统的“基准测试网格”(Benchmark Grid)已经失效——因为不同模型在相同基准上的得分差异,可能仅仅是因为它们被允许的“思考时间”不同。他进一步指出,这种评估盲区不仅影响用户对模型能力的判断,更严重的是,它正在破坏整个行业的安全评估体系:现有的负责任扩展政策(Responsible Scaling Policies)和准备框架(Preparedness Frameworks)都没有考虑推理预算这个变量,导致我们可能严重低估模型在长时间、高预算下的危险能力。
- 基准测试网格已经过时:当前行业发布新模型时,习惯性地展示一个“模型 vs 基准”的静态得分表。但Noam指出,这种比较忽略了关键变量——测试时计算预算。o1.5(5.5版本)之所以在纸面上看起来只比o1(5.4版本)提升几个百分点,是因为它更高效地利用了思考时间;如果控制思考时间,o1.5的提升是巨大的。
- 模型能力是推理预算的函数:一个模型在$10预算下的能力,与在$10,000或$10,000,000预算下的能力是天壤之别。对于某些任务(如数学证明、复杂编程),模型在持续思考数周甚至数月后,性能仍不会出现明显平台期。这意味着,我们实际上从未真正测试过任何前沿模型的能力上限。
- 安全评估存在系统性漏洞:现有的安全评估框架(如负责任扩展政策)只问“这个模型能做什么?”,而不问“在多少推理预算下它能做什么?”。Noam认为这是一个“不方便的真相”——因为如果模型在$10,000预算下能制造生物武器,但在$10预算下不能,那么安全评估应该以哪个预算为准?当前没有任何政策回答这个问题。
- 模型发布周期与评估周期严重脱节:模型每2-3个月就发布一个新版本,但真正评估一个模型在长时间尺度(如一个月)下的能力,本身就需要一个月。这意味着,当评估完成时,新模型已经发布了。结果是,没有人真正知道已发布模型的真实能力天花板。
- 递归自我改进(RSI)不会导致“一夜暴增”:Noam认为,由于前沿模型的能力高度依赖于长时间推理,时间本身就成了最大的瓶颈。即使模型能加速某些研究环节,但那些无法被加速的环节会成为新的瓶颈。因此,他更倾向于“渐进式起飞”而非“一夜之间的智能爆炸”。
- 路由层(Routing Layer)的价值需要重新审视:对于许多声称通过模型路由(如多模型共识)来提升性能的公司,Noam提出了一个尖锐的问题:当你控制住测试时计算预算后,路由方案是否仍然比让单个模型思考更长时间表现更好?如果不能回答这个问题,那么路由层的价值可能被高估。
“模型的能力不再是一个静态属性,而是你愿意为它花多少钱的函数——但整个行业的安全评估和基准测试,还在假装这个函数不存在。”
这期内容对AI从业者(尤其是做模型评估、安全、以及AI应用层的团队)有非常具体的启发:
- 评估体系需要“预算轴”:如果你在做一个AI产品的评估,不要只看模型在某个基准上的最终得分。你应该引入一个“成本轴”或“时间轴”,画出“性能 vs 推理预算”的曲线。这能帮你更真实地判断:这个模型是否真的比另一个模型好,还是仅仅因为它被允许思考了更长时间?对于产品经理来说,这意味着你需要为不同的使用场景设定不同的推理预算阈值,而不是盲目追求“最高分模型”。
- 安全评估必须动态化:如果你在做AI安全相关工作,你的评估流程需要明确回答“在什么推理预算下,这个模型是危险的?”而不是笼统地问“这个模型危险吗?”一个模型在10秒推理下是安全的,但在10天推理下可能就不安全了。你的安全策略需要为不同的预算级别设置不同的缓解措施。
- “等待下一版模型”策略的合理性:Noam提到,随着模型迭代速度加快,很多复杂的推理任务(如数学证明)的成本每2-3个月就会下降10-100倍。这对AI应用层的创业者来说是一个重要的战略信号:在某些高成本、高复杂度的推理任务上,与其现在投入大量工程资源去优化一个“昂贵”的推理流程,不如等待下一个更高效的模型版本。这不是懒惰,而是对指数级进步速度的理性回应。
- 路由层的真正价值在于预算优化:如果你在做模型路由或编排层产品,你的核心价值主张不应该只是“我们让模型更聪明”,而应该是“我们在给定的预算约束下,通过智能分配推理资源,实现了最优的性价比”。你需要能够证明:在相同的总推理成本下,你的路由方案比让单个模型思考更长时间做得更好。否则,你的产品可能只是在“花更多的钱做同样的事”。
