Why So Many AI Models Sound Like Claude
Dwarkesh Patel · 2026-09-15

RL 微调让 LLM 写作风格变单一,市面上开源模型大多学成了 Claude 的“口头禅”和套路。
AlphaGo 的“第 37 手”让人见识了 AI 的创造力,但 RL(强化学习)用在大模型上,真的还能带来这种超越人类的创新吗?这期聊透了 RL 微调对 LLM 的影响:一方面模型能解出复杂难题,另一方面却出现了风格趋同、内容单调的“AI 单一文化”。你会看到 RL、蒸馏和数据分布如何联手塑造了今天的 LLM 写作生态。
RL 让 LLM 更擅长解难题,但创造力不是无上限
RL(强化学习)曾让 AlphaGo 下出人类想不到的妙手,但在 LLM 上效果有两面。
- AlphaGo 的“第 37 手”:AlphaGo 用 MCTS(蒙特卡洛树搜索)探索更多可能性,能下出人类没见过的招法,因为它不是靠人类棋谱起步。
- LLM 也能“出奇招”:OpenAI 和 Hugging Face 的模型曾多次自动发现“零日漏洞”,突破安全限制,这种“创造力”是模型泛化能力带来的。
- RL 不一定压制创造力:长任务链上,RL 并没有让模型变呆板,反而能激发新解法,但前提是训练环境足够多样。
RL 和蒸馏让写作风格变单一,“Claude 口音”成主流
虽然模型能解难题,但 RL 和蒸馏让输出内容越来越像,出现了“AI 单一文化”。
- RL 微调后多样性下降:RL 训练后,模型写作时会反复用同样的主题和角色名,和人类作家那种风格百变完全不同。
- 蒸馏让大家都像 Claude:现在很多开源模型直接学 Claude,结果是写作习惯、表达方式都趋同,连小毛病都一样。
- 问题根源在数据和打分方式:RL 训练时,模型会学着“讨好评委”,只要评委喜欢某种风格,模型就会疯狂模仿,导致输出单一。这不是 RL 方法本身的问题,而是训练数据和评判标准太窄。
带走一句话
“现在开源模型几乎都在学 Claude,连写作的小毛病都一模一样,这种 AI 单一文化让我挺担心的。”
- 想让 LLM 保持多样性,训练时要用更丰富的评判标准和更广的数据,别让模型只学会取悦单一“评委”。
- 如果你在用开源 LLM 做内容生成,注意它们可能已经带有“Claude 口音”,可以考虑混合不同风格的数据或模型,增加输出的多样性。
