Why Kimi Suddenly Started Sounding So Much Like Claude? — Ilia Shumailov & Alexander Panfilov
Machine Learning Street Talk · 2026-08-23

研究者用小模型解密了 GPT、Claude 等主流大模型的推理记录,35 万条数据暴露大量隐私和安全风险,所有主流厂商均受影响。
大模型厂商一直用“推理记录”来追溯模型思考过程,本意是加密存储、方便后续调用。最新研究却发现,这些加密推理其实能被同家族的小模型轻松解密,甚至能跨用户、跨模型复用,导致隐私泄露、越权访问和恶意注入等新型攻击。你将看到攻击原理、真实案例、厂商应对和修复难点,理解这场大模型安全危机的全貌。
小模型能“偷听”大模型的思考,所有主流厂商都中招
研究者发现,大模型的推理记录其实很容易被自家小模型还原,所有主流厂商都未幸免。
- Ilia Shumailov 和 Alexander Panin用小模型直接解码了 GPT、Claude、Gemini 等主流模型的推理记录,无需破解加密算法。
- 攻击方式:攻击者只需把加密推理记录“塞”进小模型,模型就能自动还原原始内容。
- 横向复用:推理记录能跨用户、跨模型(如 Claude Opus 到 Claude Haiku)甚至跨会话复用,攻击面极广。
推理记录泄露带来隐私、越权和注入攻击新风险
推理记录一旦泄露,用户隐私和模型安全都面临新威胁。
- 隐私泄露:即使用户删除聊天,只要推理记录还在,攻击者就能还原出医疗信息、账号密码等敏感内容。
- 恶意注入:攻击者可用带“恶意思考”的推理记录注入他人会话,诱导模型做出异常行为或泄露数据。
- 越权访问:低权限模型能“借用”高权限模型的推理,获得本不该有的信息或能力。
修复难度大,厂商已响应但根本性问题待解
厂商已知晓漏洞并着手修复,但彻底解决需要产品和架构层面的大改动。
- 厂商反应:研究者已向 Anthropic、OpenAI、Google 等披露漏洞,厂商承认问题并启动修复,但主流产品仍受影响。
- 临时对策:最直接的方法是彻底不向用户返回推理记录,或让推理只能在特定上下文中解密,防止随意复用。
带走一句话
“基本上第三次尝试后,我就用小模型实现了对主流大模型推理的通用解密,这个事实到现在还让我震惊。”
- 用大模型处理敏感业务时,必须彻查推理记录的存储、分享和清理机制,别只删表面聊天内容。
- 产品设计时,推理记录要和上下文绑定、严格隔离访问权限,不能只相信“加密即安全”。
