Why Chinese AI Labs Are Keeping Up
Dwarkesh Patel · 2026-09-14

Anthropic 的 Sonnet 5 和 Opus 5 用上最新蒸馏技术,实际体验却被中国的 GLM 5.3 和 KMK 3 反超。
大模型行业看似会被头部公司垄断,但现实却是“学生”模型有时能反超“老师”。这背后不是技术差距,而是数据分布、蒸馏机制和真实用户场景的复杂博弈。你会看到,为什么最先进的技术和最好的数据,并不总能做出最强的模型,以及中国公司如何用“路由服务”收集真实数据,补齐短板。
大模型为什么没法像云服务那样一家独大?
本来大模型应该像云服务一样集中,但“抄作业”太容易,市场反而分散了。
- 蒸馏让能力快速复制:只要能拿到大模型的回答轨迹,小模型就能学会同样的本事,哪怕原始数据很少。
- 持续学习也挡不住被抄:大公司每天微调模型,别人也能用蒸馏同步学走新能力,抄袭速度完全跟得上。
- 中国公司用路由服务收集数据:国内公司通过路由/代理让用户用上美国前沿模型,同时收集真实提问和反馈,成为蒸馏的黄金数据集。
为什么“抄作业”有时能反超“老师”,有时却掉链子?
蒸馏能不能成功,关键在于有没有“像用户一样”的真实数据。
- Prompt 分布决定蒸馏上限:光有老师的答案不够,必须拿到覆盖面广、真实的用户提问,否则只能学会考试,遇到实际问题就掉链子。
- 中国公司用 AI 自动扩展数据:先用人类和现有数据做种子,再让 AI 自动生成海量变体,把 prompt 分布做得很全,极大提升蒸馏效果。
- 前沿实验室容易“只会考试”:如果只用难题和标准测试题训练,模型在基准测试上很强,但面对真实用户需求就容易掉链子,比如 Anthropic 的 Sonnet 5、Opus 5 在实际体验上被 GLM 5.3、KMK 3 反超。
后训练(post-training)这一步容易出岔子
最后一步微调如果参数调得太激进,模型可能“用力过猛”,用户体验反而变差。
- 后训练副作用难察觉:大模型厂商在最后微调时,容易出现奇怪的副作用,这些问题在标准测试里看不出来,但用户用起来会觉得别扭。
- 实际体验比分数更重要:模型在测试集上分数很高,但如果用户觉得不好用,实际竞争力就会被反超。
带走一句话
“蒸馏能让小模型快速学会大模型的本事,但你能不能拿到真实用户的提问,才是决定模型好坏的关键。”
- 做自家模型时,优先想办法拿到真实用户的提问和反馈,这比多用算力更重要。
- 蒸馏和数据路由让“抄作业”变得极快,未来大模型厂商要靠独特的用户场景和持续的真实数据积累,才能拉开差距。
