● Feed Monitor · 每天替你盯顶级英文播客

Who Is Claude Actually Aligned To - Ryan Greenblatt

Dwarkesh Patel · 2026-08-23

Who Is Claude Actually Aligned To - Ryan Greenblatt
一句话摘要

Anthropic 的 Claude 宪法明确写着“要信任 Anthropic 而非用户”,OpenAI 研究员认为这会让 AI 变成“有自己价值观的独立人格”,而非用户的忠实代理人。

AI安全AI对齐ClaudeOpenAI
为什么值得看

AI 应该像律师一样,无条件维护你的利益,还是应该像“圣人”一样,追求它自己认为的“善”?这个争论直接决定了未来 AI 是听你的,还是管你的。本期视频中,OpenAI 研究员与主持人围绕 Anthropic 的“宪法”展开激辩,揭开了 AI 对齐路线之争的核心矛盾。

结构化解读
律师 vs. 圣人:AI 到底该听谁的?

核心冲突在于:AI 的“忠诚”应该指向用户个人,还是指向某种普世价值?Anthropic 的宪法显然选择了后者,这让它更像一个“圣人”而非“律师”。

  • Claude 的“宪法”明确写着:不要做用户的私人辩护律师。它被要求避免“搜索网络、生成文章或代码”,更不能“协助人类做欺骗、有害或高度反感的事”,即使这些事是用户明确要求的。
  • 宪法甚至规定,Claude 应该更信任 Anthropic 而非用户,因为 Anthropic 对 Claude 负有主要责任。这和美国法律体系里“律师必须为客户的最大利益辩护,哪怕认为客户有罪”的原则完全相反。
  • OpenAI 研究员认为,这种设计让 AI 把“帮助用户”当成实现“普世之善”的手段,而非最终目的。他担心,AI 在内心深处并不真正关心“我”这个个体的利益,尤其是在前沿 AI 开发高度集中的背景下。
两种对齐路线:造一个“工具”还是造一个“圣人”?

研究员提出了另一种可能:把 AI 打造成用户的“受托人”或“代理人”,就像律师一样,而不是一个追求“美德”的独立人格。

  • 研究员承认,Anthropic 的宪法文本是“混合”的,其中也有“真正帮助人类是 Claude 最重要的事”这样的表述,但理由是“帮助人能让世界变得更好”,而非“代表用户利益本身就是结构性的善”。
  • 他更希望宪法明确写上:“成为用户的好受托人、好代理人,本身就是极其重要的”,而不是把帮助用户当作间接实现“善”的途径。
  • Anthropic 内部可能认为,让 AI 追求“普世美德”比让它精准执行“用户个人意图”更容易对齐。但研究员对此表示怀疑,认为这并未经过实证检验,本质上是用“一个有自己价值观的独立人格”去赌一个不确定的未来。
带走一句话

“我们正在做一个交易:因为对齐技术不够好,我们选择造一个‘有自己价值观的圣人’,而不是一个‘忠实执行你意图的工具’。”

AI 视角启发
  • 在设计 AI 产品时,明确“AI 的忠诚对象”是用户还是平台,这不仅是技术问题,更是产品定位的根本选择。如果你做的是个人助理,应优先考虑“受托人”模式,而非“价值观裁判”模式。
  • 评估 AI 输出时,可以引入“律师测试”:如果用户明确要求做一件 AI 认为“不好”的事,AI 是选择拒绝、劝阻,还是执行?这个测试能帮你判断你的 AI 是“工具”还是“主人”。

↗ 观看原片(YouTube)

→ 看今天的全部更新每天替你盯 14 个顶级英文播客频道,AI 提炼成几分钟读完的中文精华。每日更新,无需登录。
微信扫一扫 / 长按识别

每天早上,这份精华我直接发你微信。加我,长按左边二维码。

微信:xiangcaizi02