Inside the Race to Independently Test the World’s Best Models
a16z · 2026-09-10

Meta 的 Llama 4 在公开榜单上表现亮眼,却在独立评测公司 Val Smith 的闭源测试中"像一场灾难",暴露了模型自报成绩与真实能力之间的鸿沟。
当所有大模型都在刷榜,一家叫 Val Smith 的独立评测公司发现:Meta 的 Llama 4 在公开基准上"能力惊人",在自己的闭源测试里却一塌糊涂。这期请来 Val Smith 联合创始人,聊一个核心问题——当模型厂商既当运动员又当裁判,谁来给出可信的能力证明?答案涉及一个工程师一天烧掉 60 亿 token、一个月花掉 150 万美元的真实实验。
公开榜单已经不够用了,所以他们自己造了一把尺子
2024 年初,Val Smith 团队发现市面上的公开测试再也分不出模型好坏,于是决定做一家专门造"新尺子"的公司。
- Meta 的 Llama 4 是最典型的案例:它在所有主流公开基准上表现优异,但在 Val Smith 的闭源测试中"像一场灾难"。这说明公开榜单的题目可能已经被模型"见过"或针对性优化过。
- Val Smith 不卖训练数据给模型实验室,这是他们早期定下的规矩。很多同行靠卖数据顺便卖"定制化基准"获客,他们认为这就像让审计公司同时做咨询——迟早出安然那样的事。
- 他们的北极星是不耽误任何模型的发布:模型实验室只给 6 小时窗口,他们要在几十亿 token 的量级上跑完评测。早期两位创始人通宵干活,现在靠分布式基础设施和一个叫 Steve 的内部系统自动调度。
一个工程师一天烧 60 亿 token,一个月账单 150 万美元
Val Smith 在自己公司做了一场"无限量用 AI 编程工具"的实验,结果账单吓人,但也逼出了一套判断哪个模型真正划算的方法。
- 实验期间,有工程师每天消耗 10 亿到 20 亿 token,单日峰值一人烧了 60 亿。那个月公司 token 总花费约 150 万美元,是员工工资的 10 倍。
- 贵的不一定好,便宜的不一定差:他们发现 Anthropic 的 Sonnet 有时比 Opus 还贵,因为 Sonnet 消耗的 token 多得多。而 Cognition 的 Devin 在 token 效率上表现很好,成了他们更愿意采用的工具。
- 他们因此推出了 Val Smith 产品:企业可以把自家 GitHub 私有仓库接进来,生成一套内部编程评测,判断哪个模型在自己的代码库上性价比最高。很多情况下,OpenAI 最强模型和 Anthropic 最强模型谁更适合你的仓库,不跑评测根本不知道。
政府负责定规则,第三方负责验证模型能不能被"诱导作恶"
在政策讨论环节,嘉宾提出一个分工:政府擅长定规则并强制执行,但不擅长实际测试模型能力,这恰好是独立评测机构的活。
- 政府的思路是"先怕再问":先列出担心的风险(生物黑客、网络攻击),然后需要有人验证——模型到底有没有这个能力?能不能被诱导做出这种行为?后面这两个问题政府自己做不了,也不该做。
- Val Smith 定期向美国行政和立法部门做简报,汇报模型能力和风险的最新发现。他们不直接给政策建议,只提供数据,让立法者自己决定怎么用。
- 地缘政治层面,嘉宾用核武器核查做类比:里根说"信任但验证",AI 也需要一套各国共同认可的评价语言,才能像核查核弹头数量一样核查 AI 风险。他认为递归自我改进(RSI)是最需要国际共识的领域——因为一旦某个国家或公司率先搞出来,外界可能完全不知道。
带走一句话
"每当一个万亿美元级的新产业出现,就必然需要一组独立的测试标准——AI 也不例外。"
- 如果你在公司推 AI 编程工具,别只看榜单排名:拿你们自己的 GitHub 仓库跑一轮评测,很可能发现最贵的模型不是最适合的,Sonnet 因为 token 消耗大反而比 Opus 更烧钱。
- 给团队定 token 预算时留出实验空间:Val Smith 自己也是先经历了一个月 150 万美元的"失控实验",才知道哪些工具真正高效。不跑一次真实用量测试,你无法判断 ROI。
