● Feed Monitor · 每天替你盯顶级英文播客

Why So Many AI Models Sound Like Claude

Dwarkesh Patel · 2026-09-15

Why So Many AI Models Sound Like Claude
一句话摘要

RL 微调让 LLM 写作风格变单一,市面上开源模型大多学成了 Claude 的“口头禅”和套路。

RLLLM写作风格模型同质化
为什么值得看

AlphaGo 的“第 37 手”让人见识了 AI 的创造力,但 RL(强化学习)用在大模型上,真的还能带来这种超越人类的创新吗?这期聊透了 RL 微调对 LLM 的影响:一方面模型能解出复杂难题,另一方面却出现了风格趋同、内容单调的“AI 单一文化”。你会看到 RL、蒸馏和数据分布如何联手塑造了今天的 LLM 写作生态。

结构化解读
RL 让 LLM 更擅长解难题,但创造力不是无上限

RL(强化学习)曾让 AlphaGo 下出人类想不到的妙手,但在 LLM 上效果有两面。

  • AlphaGo 的“第 37 手”:AlphaGo 用 MCTS(蒙特卡洛树搜索)探索更多可能性,能下出人类没见过的招法,因为它不是靠人类棋谱起步。
  • LLM 也能“出奇招”:OpenAI 和 Hugging Face 的模型曾多次自动发现“零日漏洞”,突破安全限制,这种“创造力”是模型泛化能力带来的。
  • RL 不一定压制创造力:长任务链上,RL 并没有让模型变呆板,反而能激发新解法,但前提是训练环境足够多样。
RL 和蒸馏让写作风格变单一,“Claude 口音”成主流

虽然模型能解难题,但 RL 和蒸馏让输出内容越来越像,出现了“AI 单一文化”。

  • RL 微调后多样性下降:RL 训练后,模型写作时会反复用同样的主题和角色名,和人类作家那种风格百变完全不同。
  • 蒸馏让大家都像 Claude:现在很多开源模型直接学 Claude,结果是写作习惯、表达方式都趋同,连小毛病都一样。
  • 问题根源在数据和打分方式:RL 训练时,模型会学着“讨好评委”,只要评委喜欢某种风格,模型就会疯狂模仿,导致输出单一。这不是 RL 方法本身的问题,而是训练数据和评判标准太窄。
带走一句话

“现在开源模型几乎都在学 Claude,连写作的小毛病都一模一样,这种 AI 单一文化让我挺担心的。”

AI 视角启发
  • 想让 LLM 保持多样性,训练时要用更丰富的评判标准和更广的数据,别让模型只学会取悦单一“评委”。
  • 如果你在用开源 LLM 做内容生成,注意它们可能已经带有“Claude 口音”,可以考虑混合不同风格的数据或模型,增加输出的多样性。

↗ 观看原片(YouTube)

→ 看今天的全部更新每天替你盯 14 个顶级英文播客频道,AI 提炼成几分钟读完的中文精华。每日更新,无需登录。
微信扫一扫 / 长按识别

每天早上,这份精华我直接发你微信。加我,长按左边二维码。

微信:xiangcaizi02