AI Security After Codex and Claude Code — Zico Kolter & Matt Fredrikson, Gray Swan
Latent Space · 2026-06-22

AI安全不是锦上添花,而是决定企业能否大规模部署Agent的生死线——当前最前沿的自动红队系统已经比人类更擅长攻破模型,而防御方必须用专用模型而非通用提示词来应对。
这期内容适合所有正在或计划将AI Agent部署到生产环境的产品负责人、安全工程师和技术决策者。值得花时间看的原因是,它系统性地揭示了AI系统与传统软件在安全层面的根本差异——AI不是“有漏洞的软件”,而是“可以被欺骗的智能体”,这意味着传统的安全思维完全不够用。最值得注意的冲突在于:模型能力越强,并不天然越安全;而最有效的防御方案,恰恰来自最了解攻击手段的团队。此外,嘉宾还分享了一个令人警醒的发现:在特定场景下,自动红队系统已经比人类红队更擅长攻破模型。
这期节目邀请了AI安全公司Grey Swan的三位联合创始人(均来自卡内基梅隆大学),深入探讨了AI系统特有的安全挑战。他们区分了“用AI做安全”和“AI本身的安全”这两个概念,重点聚焦后者。内容覆盖了从红队测试(如何找到模型的漏洞)、防御机制(如何阻止攻击),到企业实际部署中的安全策略。特别值得一提的是,他们介绍了自己的“自动红队系统”Shade和防御模型Signal,并分享了在Claude Sonnet 4等前沿模型上的测试结果。节目还涉及了“致命三要素”框架(Lethal Trifecta),解释了为什么Agent系统特别容易受到提示注入攻击。
- AI安全与传统安全完全不同:AI系统不是“有漏洞的软件”,而是“可以被欺骗的智能体”。它们有独特的脆弱性——可以被“诱骗”做出不当行为,就像人会被钓鱼一样。这意味着传统的安全思维(如打补丁、修漏洞)需要彻底重构。
- 模型越大并不天然越安全:这是节目中最反直觉的观点之一。嘉宾展示的数据表明,模型在GPQA等能力基准上的表现与其对攻击的鲁棒性之间没有相关性。安全不是规模的自然产物,而是需要专门训练的。
- 自动红队正在超越人类:Grey Swan的自动红队系统Shade在特定任务上已经比人类红队更高效。在一次人机对抗中,Shade找到了更多漏洞。这意味着AI安全正在进入“以AI对抗AI”的新阶段。
- 提示注入是当前最大的威胁:特别是“间接提示注入”——当Agent从不可信来源获取内容时,攻击者可以在这些内容中嵌入恶意指令。这比直接提示注入更危险,因为用户甚至不知道攻击正在发生。
- 防御需要专用模型而非通用提示词:嘉宾强调,试图通过修改系统提示词来增强安全是徒劳的。他们开发的Signal模型是一个专门的“过滤器”,可以检查输入和输出,识别政策违规。这种专用模型比通用模型在安全任务上表现好得多。
- “致命三要素”是Agent安全的判断框架:一个系统是否面临严重风险,取决于三个条件同时成立:①能摄入不可信的外部数据;②能访问私有信息或执行敏感操作;③能外泄数据。只有三者齐备,才构成真正的威胁。
“如果你只是把模型做大,它不会变得更安全——安全需要专门训练,就像你需要专门训练一个红队模型来攻破它一样。”
这期内容对AI从业者最直接的启发是:安全不是事后补丁,而是产品架构的一部分。如果你在构建Agent产品,不要等到用户报告“我的Agent把我的API密钥发到了公共论坛”才开始考虑安全。嘉宾反复强调,提示词工程无法解决安全问题——你不可能通过写一段“不要被欺骗”的提示词就让模型变得鲁棒。这意味着,任何严肃的Agent产品都需要在架构层面嵌入安全层:一个独立的、专门训练的过滤器模型,而不是依赖主模型自己去判断什么该做什么不该做。
另一个重要启发是:红队测试应该成为产品开发的标准流程,就像单元测试一样。嘉宾提到,他们发现很多企业是在“事情已经发生了”之后才来找他们。对于AI产品团队来说,在发布前进行系统性的红队测试(包括自动和人工),应该成为标配。特别是,不要只测试“正常使用场景”,要测试“恶意攻击场景”——假设有人想搞破坏,他们能做什么?
最后,嘉宾关于“AI自动化科学”的讨论也值得关注:他们认为,AI应该首先被用来自动化“理解AI本身”的科学(如可解释性研究)。这对AI从业者的启示是:不要只关注用AI解决外部问题,也要关注用AI解决AI自身的问题——这可能是最被低估的应用方向。
