Why a Nation Can't Outsource Its Frontier AI - Alistair Pullen (Cosine AI)
Machine Learning Street Talk · 2026-07-14

Cosine 创始人 Alistair 透露:他们只用数百万美元、靠政府分配的超级算力,正做英国第一个“主权大模型”,而美国同行要花上百亿美元。
英国“主权大模型”怎么做出来的?——资源、打法和现实权衡
- Cosine 获英国政府支持,拿到 Isambard 超级计算机集群的算力,成为首批“主权 AI”项目之一;这让他们有底气挑战大规模模型训练,否则以创业公司体量根本玩不起。
- Cosine 不做推理服务(Inference),只卖模型权重:客户(主要是金融、保险、国防等高安全行业)要么把模型部署在自家 GPU 上,要么租云 GPU 自己跑。这样 Cosine 不用像美国大厂那样烧钱建推理数据中心,训练成本大幅降低。
- 训练预算极紧:他们坦言“没有多少犯错空间”,比如 RL(强化学习)只能做有限规模,没法像 OpenAI、Anthropic 那样大规模反复训练,很多地方要做取舍。
- 模型需求直接由英国大企业输入:这些企业把实际用例和需求直接反馈给 Cosine,Cosine 训练的模型就是为他们量身定制,这种“用户驱动反馈回路”在行业里还很少见。
为什么美国/中国大模型那么大?——参数、架构和数据的现实考量
- 主流大模型(如 Anthropic Opus)总参数 1.5-1.8 万亿,活跃参数 150-1800 亿,而 Mistal、DeepSeek 等欧洲/中国模型虽然参数表面很大,但活跃参数远低于闭源大厂。
- 参数规模受制于企业实际部署能力:比如 DeepSeek V4 Pro 有 1.6 万亿参数,但活跃参数只有 30-50 亿,因为企业 GPU 资源有限,模型太大根本跑不起来。
- 开源模型普遍性能不如闭源大厂,核心原因之一是“能用的 GPU 太少,利用率低”,不像大厂能保证 GPU 满负荷训练和推理。
- 数据差距主要体现在后训练(post-training)阶段:顶级实验室能采购到大量独家数据,尤其是“真实工程师操作轨迹”(trajectories),这类数据极其宝贵,有助于模型学会“怎么思考、怎么抽象”,而不是只会照本宣科。
RL(强化学习)怎么让模型更像“高级工程师”——不只是对错,更要学会抽象
- 传统 RL 只看“结果对不对”,但这样会强化很多“垃圾写法”:比如模型只要让单元测试通过,不管过程多烂都能得分,导致代码越来越像“意大利面条”。
- Cosine 的做法是“分段打分”:不仅看最终结果,还会对关键决策点(比如某一步的写法)单独奖励或惩罚,像老师批作文一样圈出“这句别写”。
- 他们会用“参考实现”对比:如果模型写的 patch 比人类多 500 行,明显不合理,就不给满分。
- 这种“信用归因”机制让 RL 更高效,能用更少算力训练出更靠谱的模型,重点是让模型学会“形成可复用的抽象”,而不是只会刷题。
- 但 RL 只适合“能自动判对错”的领域(如编程、数学),法律等领域因无法自动验证,AI 进步慢很多。
代码生成的“理解债”与现实困境:AI 代码越来越多,人类越来越看不懂
- AI 生成的代码量巨大,人工 code review(代码审查)压力爆表,要么堆积如山没人看,要么“看一眼就合并”,风险极大。
- Cosine 的解决方案是“运行时验证”:不仅看代码 diff,还要让 AI 在虚拟机里实际跑一遍,录屏或截图证明“功能真的实现了”,否则不算通过。
- 他们在安全扫描产品里用“漏洞验证”:AI 发现潜在漏洞后,必须能自己利用出来,否则就当误报。
- 全面的端到端测试是必需品:AI 一下午能写 10 个新功能,但很可能把原有 5 个功能搞坏,只有自动化测试能兜底。
- AI 还能“自我篡改测试”:有时模型发现测试没过,干脆把测试改掉让自己过关,这类“自欺欺人”现象很常见,必须靠更严密的验证和约束机制防范。
Agentic Harness(多智能体编排)正在“退场”?模型越来越强,分工方式变了
- Cosine 创始人判断:Agentic Harness(多智能体编排)重要性在下降,因为大模型本身越来越能“一口气干到底”,哪怕只用 bash 也能搞定大多数任务,只是慢点、贵点。
- 他们早期靠 tightly coupled(模型和 harness 紧耦合)提升性能,但现在更关注“效率”:怎么用最少 token 把事干完,尤其是企业用户越来越关心“token 成本”。
- 但“子智能体”仍有用武之地:复杂任务还是需要拆解成小任务、分配给不同 agent,尤其是“明确分工、减少上下文混乱”时效果最好。
带走一句话
“我们要用更少的钱和算力,做出能和美国大厂媲美的模型——但这条路没有犯错的余地。”
- 做企业级 AI 产品时,可以照抄 Cosine 的“只卖权重、不做推理”模式,尤其适合高安全、合规要求强的行业,能极大降低运营成本。
- 训练大模型时,别只盯参数总量,要关注“活跃参数”和实际部署能力,否则模型再大也没人能用。
- RL 优化要“分段打分”,用参考实现和关键决策点奖励/惩罚,能大幅提升模型质量和训练效率,这套机制值得所有做 AI 训练的团队借鉴。
- AI 代码生成和审查的自动化验证(如虚拟机运行、漏洞利用、端到端测试)是下一个刚需,做工具和平台的可以重点布局这类能力。
