● Feed Monitor · 每天替你盯顶级英文播客

Why Everyone Suddenly Loves Opus 5.5 Again

The AI Daily Brief · 2026-09-26

Why Everyone Suddenly Loves Opus 5.5 Again
一句话摘要

两天内 OpenAI 和 Anthropic 连发四款模型:Opus 5.5 智能指数冲到 58 分反超对手 5 分,GPT-6 Soul/Luna 则把 API 价格砍到上一代的一半。

大模型AnthropicOpenAI价格战
为什么值得看

同一个下午,两家最强实验室同时发新模型,这种场面此前几乎没出现过。更反常的是:一边是 Opus 5.5 被开发者称为"Claude 回来了",另一边 OpenAI 干脆不谈跑分,只画了一张"性能对成本"的图。这期把两家各自的算盘、真实用户反馈和翻车点都摆了出来。

结构化解读
Anthropic 这次是真把 Opus 找回来了

Opus 系列从 4.6 之后一路被自家 Mythos、Fable 压着打,5.0 更是被骂惨,5.5 是第一次让老用户主动想回来。

  • 智能指数 58 分,比并列第一的 Claude Fable 5.1 和 GPT-6 Astra(各 53 分)高出整整 5 分,是 Artificial Analysis 榜单上目前最高分。
  • Terminal Bench 4.0 从 55.8% 跳到 66.4%,Cursor Bench、Frontier Code v1.1、Humanity's Last Exam 全部同步上涨,没有一项跑分输给自家旧模型。
  • 价格反而降了:每百万输入 token 从 5 美元降到 4 美元,输出从 25 降到 20,加上效率提升,实际省下约 40%;Box 团队实测 token 用量少 63%、啰嗦程度低 42%、速度快 30%。
写作和"性格"成了这轮最意外的卖点

Anthropic 官方账号直接发了一句"Opus 5.5 比 Opus 5 好太多,那个模型我们很抱歉,试试这个"——这种认错式营销很少见。

  • Every 团队评价:这是他们见过的 Anthropic 或 OpenAI 模型里可读性最强的文本,Opus 5 曾让他们的写手弃用 Claude,5.5 又把人拉了回来。
  • Anthropic 的 Sholto Douglas 转发时只写了一句"重要新闻:我们把写作修好了",用户普遍反映它不再堆破折号、会把重点放开头、能按你给的规则写。
  • 3D 和视觉生成被反复演示:Jake Eaton 用约 7500 行 Python 逐像素模拟不同画家的笔触,全程不用图像模型;Alex Albert 只用 Opus 5.5 加 Blender 复原了 1906 年旧金山 Market 街景。
OpenAI 不谈跑分,只谈"每个任务多少钱"

GPT-6 Soul 和 Luna 的发布帖几乎没提基准测试,通篇在讲成本和吞吐,Altman 说"每个任务的成本才是最重要的指标"。

  • API 价格比 GPT-5.6 的促销价还低 50%,Soul 和 Luna 定位是"用五分之一的价钱拿到 Astra 的大部分能力",被比作 iPhone 的 S 代升级。
  • OpenAI 研究员日均消耗 600 美元 token,前 10% 的重度用户每天烧掉 7000 美元——这是他们解释为什么要死磕成本的理由。
  • Artificial Analysis 的结论很直白:任何用 GPT-5.6 的工作流都该换成 Soul 或 Luna,更便宜且更好,这种情况很少见。
带走一句话

"性格就是用户体验,我们必须按这个前提来对待它。"

AI 视角启发
  • 如果你现在的工作流绑在某个生态里(比如 Codex 或 Claude Code),先别急着迁移:Will Brown 的实测是,模型再好也打不过"联系人、工具、规则都在这边"的迁移成本,真正该做的是按任务类型分配模型,而不是全押一家。
  • 值得直接抄的动作:把团队里跑 GPT-5.6 的批处理任务换成 Soul/Luna 试一周,同时把需要长文档写作和复杂代码的活交给 Opus 5.5,用真实账单对比而不是跑分来决定。

↗ 观看原片(YouTube)

→ 看今天的全部更新每天替你盯 14 个顶级英文播客频道,AI 提炼成几分钟读完的中文精华。每日更新,无需登录。
微信扫一扫 / 长按识别

每天早上,这份精华我直接发你微信。加我,长按左边二维码。

微信:xiangcaizi02