● Feed Monitor · 每天替你盯顶级英文播客

Gemini 4 Argon, Sonnet 5.5 and What Models You Should Be Using Right Now

The AI Daily Brief: Artificial Intelligence News · 2026-10-03

Gemini 4 Argon, Sonnet 5.5 and What Models You Should Be Using Right Now
一句话摘要

Google 发布 Gemini 4 Argon,VAULT 知识工作基准 68.9% 反超 Opus 5.5,却以网络安全为由暂不开放。

GoogleGeminiAI竞赛Agent
为什么值得看

Google 被唱衰一整年,这周 Gemini 4 在多个基准重回第一梯队,但发布当天没人能用——官方说它在网络安全测试上得分太高,怕被滥用。更尴尬的是 Bloomberg 爆料内部员工嫌它写代码不行。这期把"基准分数"和"真实体验"之间的裂缝摊开给你看。

结构化解读
Google 回来了,但你用不上

Gemini 4 Argon 是 Google 六个多月来第一个前沿模型,数据漂亮,可发布当天普通用户碰不到它。

  • 知识工作基准领先:VAULT 指数 68.9%,超过 Fable 5.1 和 GPT-6 Astra,比此前领先者 Opus 5.5 高几个百分点;Harvey 法律 Agent 基准 19.6%,是 Fable 5.1 的三倍多。
  • 编程仍是短板:Terminal Bench 4.0 只拿 57.4%,比 Opus 5.5 低 9 个百分点,排末尾;Frontier Suite 55%,落后 Astra 10 分。
  • 不开放的理由是网络安全:CWE bench 拿到 68%,与 Grok 4.7、GPT-6 Astra 持平,Google 只向"可信网络防御者"开放,之后再扩到 API 和 Ultra 订阅。
基准分数和真实体验,这次对不上

Google 说模型内部大规模测过,但 Bloomberg 的报道给出相反画面。

  • 员工说它写代码不行:Bloomberg 报道称模型基准好,员工实际用时"难以处理某些编程任务";Google 否认,另有信源称抱怨者是少数。
  • Google 有前科:Gemini 3.1 Pro 发布时官方基准"全面碾压 Opus 4.6",结果口碑翻车,所以这次 X 上"Google is so back"下面质疑声同样密集。
  • Logan Kilpatrick 的回应:他说 Google 现在让新模型先在数千名工程师手里跑几周再发布,想以此缩小基准和现实的差距。
光有好模型已经不够了

Peter Yang 一句话点破:模型好只是入场券,harness 和产品体验才是现在的战场。

  • Anthropic 的 Sonnet 5.5 是反例:Terminal Bench 4.0 从 Sonnet 5 的 10.3% 跳到 70.6%,超过 Opus 5.5 的 66.4%,但 Artificial Analysis 实测它每任务花 7.60 美元,比 Opus 5.5 贵 27%,因为太能吃 token。
  • Muse 证明产品体验的价值:上线三周多,周活 300 万、日活 100 万,Codex 花了约三个月才到 300 万周活;但用户 Sina 已抱怨底层模型"不够聪明、经常出错"。
  • DoorDash 自己下场做 Agent:用户发短信"把我常点的蛋白碗送到办公室",Agent 自动匹配手机号、查历史订单和地址、完成支付;DoorDash 称 Agent 下单的杂货客单价高出 50%。
带走一句话

"作为一个消费者,我的忠诚不属于任何一家。如果 OpenAI 用他们的模型做出 Muse,我就用最好的那个。智能仍然是护城河。"

AI 视角启发
  • 评估模型别只看发布基准,去查 Artificial Analysis 这类第三方实测的每任务成本和 token 消耗——Sonnet 5.5 官方说便宜 30%,实测却比 Opus 5.5 贵 27%,差距全在 token 用量。
  • 做 Agent 产品可借鉴 DoorDash 的双轨策略:既对第三方 Agent 开放,又自建平台内 Agent 抓住用户关系,因为自建 Agent 的客单价能高出 50%。

↗ 观看原片(YouTube)

→ 看今天的全部更新每天替你盯 14 个顶级英文播客频道,AI 提炼成几分钟读完的中文精华。每日更新,无需登录。
微信扫一扫 / 长按识别

每天早上,这份精华我直接发你微信。加我,长按左边二维码。

微信:xiangcaizi02