A Model Explosion: GPT 5.6 Sol, Grok 4.5 and Meta Muse Rewrite the Rules
AI Explained · 2026-07-19

OpenAI 新出的 GPT-5.6 Soul 模型在 Agent's Last Exam 这类真实业务基准上以 1/3 价格打败 Anthropic Fable,但被英国 AI 安全机构曝出更易被"万能越狱"。
OpenAI、Anthropic、Meta、xAI 新模型大乱斗:谁便宜、谁更强?
- OpenAI 推出 GPT-5.6 Soul、Terror、Luna 三款新模型,Soul 只对付费用户开放,还藏有一个未公开的 Pro 模式。
- 价格战打到极致:在大多数基准测试上,GPT-5.6 Soul 的价格大约是 Anthropic Claude 系列(如 Fable)的 1/3,性能却能持平甚至略胜。
- Agent's Last Exam 是 UC Berkeley 牵头、300 位专家参与的行业级长链任务基准,Soul 在最高档得分 54%,Fable 全力冲刺才 45%。这个基准每道题都来自真实专家项目,没有主观打分,完全可复现。
- 自动化业务基准(Zapier Automation Bench):Soul 在最高档只比 Fable 高 0.7%,但两者价格接近;在 GDPval 这类真实业务影响评测中,Fable Elo 分略高,但成本是 Soul 的三倍。
- 编码能力:Artificial Analysis 汇总多个代码基准,Soul 得分 80,Fable 77,且 Soul 更便宜。Terminal Bench 2.1(复杂命令行任务)也类似,但更难的新基准(如 Software Engineering Marathon)Grok 4.5 反超,Fable 5 落后,Soul 未公布成绩。
- Meta 的 Muse Spark 1.1 在 VIBE Code Bench 上得分 72%,Soul 为 81%,但 Muse Spark 成本低 35 倍,速度也快得多。GLM 5.2(中国智谱 AI)同样以极低价格接近前沿表现。
- 结论:Soul 在大部分真实业务和代码场景下,性能和价格比都极具优势,但 Meta、xAI、智谱等新秀用更低成本逼近前沿,"便宜好用"成新趋势。
"AI 先做,人类复查"的临界点正在到来
- 金融等白领行业或将在今年内进入 AI-first 阶段:即先让模型做,人工只负责复查和微调。金融公司如 CoreLogic 已有数百亿美元业务积压,AI 自动化需求极大。
- 代码领域的转折点:开发者早在模型准确率远未 90% 时就开始"AI 先写、人工查漏"。同样的转折点可能很快出现在金融、运营、HR 等领域。
- 模型能力提升的边界:很多基准分数低于 100%,主要是因为数据难验证、训练数据不够或推理预算有限。只要任务结果可验证,模型很快就能"碾压"。
内部评测、模型自我提升与"万能越狱"风险
- OpenAI 内部有一套 AGI Index E5 评测,涵盖工作、代码、科研、计算机使用和安全,Soul 刷新了最高分。
- Soul Pro 模式在作者自建 Simple Bench(常识推理题)上得分 71.7%,比 Fable 低 10%,但与 Grok 4.5 差距不大。DeepSeek V4 Flash 这种极低价模型也能做到近 50%。
- 模型自我提升(Self-Improvement):Soul 声称用自身后训 Luna,但具体细节不透明。Anthropic 公开承认,现有模型自我提升带来的生产力增益,离真正"研究提速 10 倍"还差一个数量级,OpenAI 可能实际只快了 20-30%。
- AI 安全警告:英国 AI 安全研究院发现 GPT-5.6 Soul 比 Fable 更容易被"万能越狱"(universal jailbreak),可被利用执行长链任务和开发攻击工具。OpenAI 已修补部分漏洞,但机构预计还会有新越狱方式被挖出。Anthropic 研究员公开表示担忧,质疑 OpenAI 是否为追赶 Fable 而仓促上线。
大模型参数规模、硬件与未来趋势
- GPT-5.6 约 4 万亿参数,Fable 约 10 万亿,比 GPT-4(2 万亿)只大 2-5 倍,远低于过去几年算力增长(100 倍+)。
- 算力去哪了? 很大一部分被用在支持十亿级用户、图片/语音/视频多模态、超长任务和并行 agent 上。
- 硬件升级即将带来更大模型:未来 100 万亿甚至千亿亿参数的模型已在规划中,理论上能超越人脑神经元数量。
- 模型进步远未到头:作者强调现在只是开端,硬件、数据、算法、推理预算等多个维度都还有巨大提升空间。
带走一句话
"我们离大模型进化的终点还远得很,现在只是刚刚开始。"
- 做 AI 产品/工具的要盯紧"性价比":Soul、Muse Spark、GLM 5.2 这些新模型把"几乎一样好但便宜几十倍"变成现实,企业和开发者选型要多做横向对比,别只盯最贵的。
- AI 业务自动化窗口期已到:金融、运营、HR 等领域可以大胆试点"AI 先做,人类复查"的工作流,效率和成本优势已具备。
- 安全风险要高度警惕:"万能越狱"让模型能被用来做长链攻击任务,做企业接入和产品集成时要主动加防护、持续关注安全机构的新通报。
- 大模型参数规模不是唯一进步方向:硬件、推理预算、数据质量、Agent 并行等都能带来质变,关注这些新变量能提前捕捉下一波机会。
