Why Everyone Suddenly Loves Opus 5.5 Again
The AI Daily Brief · 2026-09-26

两天内 OpenAI 和 Anthropic 连发四款模型:Opus 5.5 智能指数冲到 58 分反超对手 5 分,GPT-6 Soul/Luna 则把 API 价格砍到上一代的一半。
同一个下午,两家最强实验室同时发新模型,这种场面此前几乎没出现过。更反常的是:一边是 Opus 5.5 被开发者称为"Claude 回来了",另一边 OpenAI 干脆不谈跑分,只画了一张"性能对成本"的图。这期把两家各自的算盘、真实用户反馈和翻车点都摆了出来。
Anthropic 这次是真把 Opus 找回来了
Opus 系列从 4.6 之后一路被自家 Mythos、Fable 压着打,5.0 更是被骂惨,5.5 是第一次让老用户主动想回来。
- 智能指数 58 分,比并列第一的 Claude Fable 5.1 和 GPT-6 Astra(各 53 分)高出整整 5 分,是 Artificial Analysis 榜单上目前最高分。
- Terminal Bench 4.0 从 55.8% 跳到 66.4%,Cursor Bench、Frontier Code v1.1、Humanity's Last Exam 全部同步上涨,没有一项跑分输给自家旧模型。
- 价格反而降了:每百万输入 token 从 5 美元降到 4 美元,输出从 25 降到 20,加上效率提升,实际省下约 40%;Box 团队实测 token 用量少 63%、啰嗦程度低 42%、速度快 30%。
写作和"性格"成了这轮最意外的卖点
Anthropic 官方账号直接发了一句"Opus 5.5 比 Opus 5 好太多,那个模型我们很抱歉,试试这个"——这种认错式营销很少见。
- Every 团队评价:这是他们见过的 Anthropic 或 OpenAI 模型里可读性最强的文本,Opus 5 曾让他们的写手弃用 Claude,5.5 又把人拉了回来。
- Anthropic 的 Sholto Douglas 转发时只写了一句"重要新闻:我们把写作修好了",用户普遍反映它不再堆破折号、会把重点放开头、能按你给的规则写。
- 3D 和视觉生成被反复演示:Jake Eaton 用约 7500 行 Python 逐像素模拟不同画家的笔触,全程不用图像模型;Alex Albert 只用 Opus 5.5 加 Blender 复原了 1906 年旧金山 Market 街景。
OpenAI 不谈跑分,只谈"每个任务多少钱"
GPT-6 Soul 和 Luna 的发布帖几乎没提基准测试,通篇在讲成本和吞吐,Altman 说"每个任务的成本才是最重要的指标"。
- API 价格比 GPT-5.6 的促销价还低 50%,Soul 和 Luna 定位是"用五分之一的价钱拿到 Astra 的大部分能力",被比作 iPhone 的 S 代升级。
- OpenAI 研究员日均消耗 600 美元 token,前 10% 的重度用户每天烧掉 7000 美元——这是他们解释为什么要死磕成本的理由。
- Artificial Analysis 的结论很直白:任何用 GPT-5.6 的工作流都该换成 Soul 或 Luna,更便宜且更好,这种情况很少见。
带走一句话
"性格就是用户体验,我们必须按这个前提来对待它。"
- 如果你现在的工作流绑在某个生态里(比如 Codex 或 Claude Code),先别急着迁移:Will Brown 的实测是,模型再好也打不过"联系人、工具、规则都在这边"的迁移成本,真正该做的是按任务类型分配模型,而不是全押一家。
- 值得直接抄的动作:把团队里跑 GPT-5.6 的批处理任务换成 Soul/Luna 试一周,同时把需要长文档写作和复杂代码的活交给 Opus 5.5,用真实账单对比而不是跑分来决定。
