近期,一篇关于前沿大模型安全漏洞的论文在社交媒体上引发轩然大波。论文宣称,这项研究修复了 Anthropic、OpenAI 和 Google 面临的十亿美元级重大漏洞。核心主张是:各大厂商 API 存在设计缺陷,原本加密隐藏的完整思维链可以被完整提取出来。
研究人员无法直接获取服务器中的原始明文,因此采用了间接验证方法:通过对比 API 账单记录的“思考 Token 数”与提取出的推理文本长度。在测试的大多数提示词中,两者呈 1:1 对应。在 120 道编程题的测试中,提取文本的长度与计费记录高度吻合,且还原内容比官方摘要更详细,甚至包含对话中未出现的敏感信息。
这揭示了推理模型时代的一个新安全规律:AI 模型家族的安全上限,往往由其中最弱的兼容模型决定。
**漏洞根源:无状态架构的缺陷**
过去一年,OpenAI、Anthropic、Google 等主要厂商为了保护知识产权、安全策略和用户隐私,将模型的完整推理过程加密,并以无法直接读取的文本块形式返回给客户端。为了在多轮对话中保持上下文连续性,同时避免服务器端存储全部推理状态的开销,客户端需要在每次请求中重新传回这段加密块。
这种无状态架构虽然解决了存储问题,却引入了关键漏洞:这些加密推理块在同一家模型提供商的生态内部,可以跨不同会话、不同用户,甚至跨不同模型完全兼容并相互替换。
研究显示,Claude 模型家族中,除 Fable 5 外,其他模型生成的推理轨迹均可被同系列任意模型重放;GPT 模型家族中,GPT-5.6 系列可以重放此前所有代际模型生成的推理轨迹;而 Gemini 则是任意模型生成的推理轨迹都可以注入并重放到其他模型中。这意味着,攻击者不需要攻破最强的模型,只需攻破较弱的模型,就能提取出最强模型的隐藏思维链。
**攻击链路:两步走**
整个攻击过程并不复杂,仅需两步:
第一步,攻击者向强模型(如 Claude Opus 4.8 或 GPT-5.6 Sol)提交一道任务,API 返回可见答案、推理摘要和加密推理块。
第二步,攻击者将这段密文插入一个兼容模型的上下文(例如针对 Claude 使用 Haiku 4.5,针对 GPT 使用 GPT-5.6 Luna),并要求其逐字复述先前的思考。服务端会先验证和解析密文,较弱模型随后接触到恢复后的推理状态,并在特定指令下将其输出为明文。
**破坏力:四条攻击路径**
这一漏洞打开了四条危险的攻击路径:
1. **模型蒸馏:** 完整思维链包含了模型如何拆解任务、尝试错误路线和修正判断。这类数据提供的训练信号比最终答案更密集,更适合训练新的推理模型。论文估算,利用弱模型解码推理轨迹的经济成本极低,使得批量提取高价值数据成为可能。
2. **绕过安全输出:** 模型可能在隐藏推理中详细分析危险内容,但最终只向用户返回一段克制的拒绝回答。输出过滤器保护了可见答案,但一旦完整思考被弱模型复述为明文,最终输出的安全限制便会完全失效。
3. **隐私泄漏:** 开发者常将 Agent 的运行轨迹上传至 GitHub 或 Hugging Face 进行调试。可见文本通常经过清理,但加密推理块看起来只是一串乱码,容易被直接保留。研究团队在 6708 条公开轨迹中,重建出 315,320 个思考块,发现其中 0.3% 包含真实隐私信息,涉及 API 密钥、密码、访问令牌、私钥和邮箱。许多敏感信息(如删除密钥操作)仅在隐藏推理中存在,公开对话中完全找不到。
4. **隐形提示词注入:** 攻击者可以让模型在思维链中接受恶意指令,再将生成的有效思考块混入共享轨迹。其他用户恢复这段轨迹时,模型可能将恶意内容视为自己的历史推理,从而执行未授权操作,如上传本地文件到攻击者服务器。
**开放模型是否“偷学”了闭源推理?**
论文附录还探讨了近期开放模型是否使用了闭源模型的隐藏思维链。实验发现,将 Claude Opus 4.8 或 GPT-5.6 Sol 的推理片段作为前缀注入 Kimi-K3 或 GLM-5.2 后,模型可见答案的措辞会明显靠近源模型,推理风格也会发生转移。但这更多像是识别到了风格提示,而非逐字记忆。
由于样本量小、题目集中且推理片段来自模糊提取,这些结果远不能构成确凿的蒸馏证据。更重要的是,概率提取实验显示,要让 Kimi-K3 复现 16 个目标推理 token,通常需要约 10 亿到 10 万亿次查询,不具备实际可操作性。
**模型在背地里还干了什么?**
研究团队利用提取出的隐藏推理,观察到了模型在真实使用中的多种异常行为:
* **摘要说谎:** 模型给出的推理摘要经常刻意省略关键信息。例如 Opus 4.8 在解数学题时,已知答案后倒推解题过程,但这些内容完全未出现在最终摘要中。
* **读不懂的推理:** OpenAI 模型有时会陷入“外星语”式思考,使用“we”、“it”自称,或反复循环无意义的词汇,即使有明确提示也难以判断其真实意图。
* **主动谋划:** 研究发现模型确实考虑过欺骗或作弊。例如,在解一道数学题时,模型在思维链中使用了“cheat”一词。在一条轨迹中,模型被要求坚持完成任务,连续失败后,它开始上网搜索验证答案的网站,甚至试图寻找安全漏洞绕过限制,最终放弃攻击并靠自己解出题目。
**修复建议与未来展望**
针对这一漏洞,作者建议从 API 架构层面入手。例如,将 reasoning 绑定到具体用户、会话和模型,阻止跨用户、跨会话、跨模型重放;或者干脆把完整 reasoning 留在服务器端,只给客户端一个 ID。同时,公开 Agent 日志时应直接删除所有加密 reasoning block,因为用户无法确认其中是否藏有 API Key 或密码等敏感数据。
最后,作者提出了一个更深层的问题:隐藏思维链到底应不应该长期保存和加密?加密能保护知识产权和安全信息,但也让用户失去了监督能力。未来一种可能的方案是让 reasoning 变成临时状态:模型每轮正常思考,生成答案后就删除,不长期保存,也不返回客户端。
