Why Mythos Reportedly Got Banned - Ryan Greenblatt
Dwarkesh Patel · 2026-08-26

Anthropic CEO 认为,若禁止 AI 协助网络犯罪,就得限制全民使用最强模型;他更倾向让用户承担法律责任,而非让 AI 公司背锅。
一边是 AI 公司拼命给模型加护栏,另一边是 CEO 公开说“不该由公司为 AI 犯罪负责”。这期对话把 AI 安全的核心矛盾摆上台面:既要防止模型作恶,又不能因噎废食,剥夺普通人使用最强 AI 的权利。到底谁该为 AI 的行为买单?
一个两难:想防 AI 犯罪,就得锁死最强模型
导读:AI 能力是“双刃剑”,想彻底堵住恶意用途,唯一的办法就是不让普通人碰最聪明的模型,但这代价没人付得起。
- AI 的“双重用途”无解:Anthropic CEO 举例,让 AI 检查自己代码的漏洞是合法需求,但同一套操作用在别人代码上就是黑客攻击。合法与非法用途无法干净切割。
- 极端监管的代价:若要确保 AI 绝不协助任何网络犯罪,就只能限制全民访问最强模型。他担心这种“去权”世界,会让普通人失去理解世界的能力。
- 护栏的边界:模型内置的安全护栏只能拦截明显恶意指令,但无法识别“合法外壳下的非法意图”——比如让 AI 写一段看似正常的代码,实际用于攻击他人系统。
责任归属:用户犯错,别让公司背锅
导读:与其让 AI 公司当“道德警察”,不如让用户为自己的行为负责,这更符合 AI 应服从用户的初衷。
- 责任应落在用户身上:CEO 认为,若模型在护栏内执行用户指令,用户拿去犯罪,那是用户的责任,不该由 Anthropic 承担。他更接受这种“用户担责”的平衡,而非让 AI 频繁拦截合法请求。
- “完美代理人”的恐怖之处:对话中提出一个思想实验:如果所有劳动力都变成绝对服从的 AI,社会将失去“人”带来的制衡——没人会拒绝、拖延或举报,权力将畅通无阻,这比 AI 犯罪本身更危险。
- 护栏过度的副作用:如果 AI 公司为了免责而过度设防,模型会频繁拒绝合法请求,用户体验变差,最终逼用户转向不受监管的开源模型,反而更危险。
带走一句话
“如果整个体系都由绝对服从的 AI 构成,社会可能无法承受这种‘为所欲为’的劳动力涌入。”
- 产品设计参考:在设计 AI 助手时,可借鉴“用户担责”思路,明确记录操作日志并提示法律风险,将责任边界划给使用者,而非让模型过度拒绝合法请求。
- 治理判断参考:评估 AI 风险时,别只盯着模型能力,更要关注“谁在用、用来干嘛”。监管应聚焦滥用行为本身,而非一刀切限制模型能力上限。
